RL Residual Centrado em Objetos para Aprimoramento de VLA Sim-para-Real com Zero-Shot
Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement
June 17, 2026
Autores: Kinam Kim, Namiko Saito, Heecheol Kim, Katsushi Ikeuchi, Jaegul Choo, Yasuyuki Matsushita
cs.AI
Resumo
Modelos Visão-Linguagem-Ação (VLA) conseguem generalizar para diversas tarefas de manipulação, mas suas políticas baseadas em aprendizado por imitação permanecem frágeis em interações físicas precisas devido a erros de execução compostos. Será que uma política de aprendizado por reforço treinada puramente em simulação pode melhorar a robustez de VLAs do mundo real sem necessidade de ajuste adicional (zero-shot)? O RL residual, que aprende uma política corretiva sobre um VLA congelado, oferece uma estrutura natural, mas abordagens existentes enfrentam um dilema fundamental de sim-para-real: métodos baseados em estado privilegiado exigem destilação com perdas para implantação; métodos baseados em imagem sofrem com a lacuna de domínio visual; e RL no mundo real é caro e inseguro. Propomos uma estrutura de RL residual centrada em objetos, que refina as ações do VLA usando poses de objetos, permitindo um espaço de observação compacto que transfere consistentemente entre simulação e realidade. Para alinhar os dois domínios, adicionalmente reproduzimos as mesmas demonstrações de teleoperação em simulação para treinar um equivalente simulado do VLA do mundo real. A política de RL residual é treinada apenas em simulação com injeção de ruído de pose e dropout, e transfere-se sem ajuste (zero-shot) para o robô real. Em cinco tarefas de manipulação em um robô real Franka Research 3 (FR3), nosso método melhora a taxa de sucesso de 42% para 76% sem ajuste, e as trajetórias melhoradas podem ser reutilizadas para retreinar o VLA base para autoaperfeiçoamento, sem necessidade de teleoperação adicional. Página do projeto: https://www.microsoft.com/en-us/research/articles/object-centric-residual-rl/
English
Vision-Language-Action (VLA) models can generalize across diverse manipulation tasks, but their imitation-learning-based policies remain brittle in precise physical interactions due to compounding execution errors; Can a reinforcement learning policy trained purely in simulation improve the robustness of real-world VLAs zero-shot? Residual RL, which learns a corrective policy on top of a frozen VLA, offers a natural framework, but existing approaches face a fundamental sim-to-real dilemma: privileged-state methods require lossy distillation for deployment; image-based methods suffer from the visual domain gap; and real-world RL is costly and unsafe. We propose an object-centric residual RL framework that refines VLA actions using object poses, enabling a compact observation space that transfers consistently between simulation and reality. To align the two domains, we additionally replay the same teleoperation demonstrations in simulation to train a sim counterpart of the real-world VLA. The residual RL policy is trained only in simulation with pose noise injection and dropout, and transfers zero-shot to the real robot. Across five manipulation tasks on a real Franka Research 3 (FR3) robot, our method improves the success rate from 42% to 76% zero-shot, and the improved rollouts can be further reused to retrain the base VLA for self-improvement without additional teleoperation. Project page: https://www.microsoft.com/en-us/research/articles/object-centric-residual-rl/