Aprendizado durante a Implantação: Aprendizado por Reforço em Escala de Frota para Políticas de Robôs Generalistas
Learning while Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies
May 1, 2026
Autores: Yi Wang, Xinchen Li, Pengwei Xie, Pu Yang, Buqing Nie, Yunuo Cai, Qinglin Zhang, Chendi Qu, Jeffrey Wu, Jianheng Song, Xinlin Ren, Jingshun Huang, Mingjie Pan, Siyuan Feng, Zhi Chen, Jianlan Luo
cs.AI
Resumo
As políticas de robôs generalistas beneficiam-se cada vez mais do pré-treinamento em larga escala, mas os dados offline por si só são insuficientes para uma implantação robusta no mundo real. Os robôs em operação encontram mudanças de distribuição, falhas de cauda longa, variações de tarefas e oportunidades de correção humana que conjuntos de dados de demonstração fixos não conseguem capturar totalmente. Apresentamos o Aprendizado Durante a Implantação (LWD), uma estrutura de aprendizagem por reforço offline-para-online em escala de frota para o pós-treinamento contínuo de políticas generalistas Visão-Linguagem-Ação (VLA). Partindo de uma política VLA pré-treinada, o LWD fecha o ciclo entre implantação, experiência física compartilhada, melhoria de política e reimplantação, utilizando rollouts autónomos e intervenções humanas recolhidas em toda uma frota de robôs. Para estabilizar a aprendizagem a partir de dados heterogéneos e de recompensa esparsa da frota, o LWD combina a Aprendizagem de Valor Implícito Distribucional (DIVL) para estimativa robusta de valor com o Q-learning por Correspondência Adjunta (QAM) para extração de políticas em geradores de ação VLA baseados em fluxo. Validamos o LWD numa frota de 16 robôs de dois braços em oito tarefas de manipulação do mundo real, incluindo reabastecimento semântico de mercearia e tarefas de longo horizonte de 3 a 5 minutos. Uma única política generalista melhora à medida que a experiência da frota se acumula, atingindo uma taxa média de sucesso de 95%, com os maiores ganhos em tarefas de longo horizonte.
English
Generalist robot policies increasingly benefit from large-scale pretraining, but offline data alone is insufficient for robust real-world deployment. Deployed robots encounter distribution shifts, long-tail failures, task variations, and human correction opportunities that fixed demonstration datasets cannot fully capture. We present Learning While Deploying (LWD), a fleet-scale offline-to-online reinforcement learning framework for continual post-training of generalist Vision-Language-Action (VLA) policies. Starting from a pretrained VLA policy, LWD closes the loop between deployment, shared physical experience, policy improvement, and redeployment by using autonomous rollouts and human interventions collected across a robot fleet. To stabilize learning from heterogeneous, sparse-reward fleet data, LWD combines Distributional Implicit Value Learning (DIVL) for robust value estimation with Q-learning via Adjoint Matching (QAM) for policy extraction in flow-based VLA action generators. We validate LWD on a fleet of 16 dual-arm robots across eight real-world manipulation tasks, including semantic grocery restocking and 3--5 minute long-horizon tasks. A single generalist policy improves as fleet experience accumulates, reaching an average success rate of 95%, with the largest gains on long-horizon tasks.