Robots doing repetitive tasks can reuse cached visual features and neuron activations from previous executions, cutting VLA inference time by 30-40% without sacrificing accuracy—critical for real-time robot responsiveness.
This paper presents rMuscle, a framework that speeds up Vision-Language-Action (VLA) models for robot control by caching and reusing computation across repeated tasks.