ChatPaper.aiChatPaper

Relatório Técnico do Qwen-RobotManip: Alinhamento Desbloqueia Escala para Modelos de Fundação de Manipulação Robótica

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

June 17, 2026
Autores: Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen
cs.AI

Resumo

Modelos fundamentais em linguagem e multimodalidade alcançam forte generalização ao alinhar dados heterogêneos sob uma formulação unificada e treinamento em escala. Neste relatório, investigamos se esta receita de escalonamento pode ser aplicada à manipulação robótica para alcançar uma generalização genuína. Isso é desafiador porque, diferentemente do texto, os dados de manipulação são heterogêneos por natureza, caros de coletar e estreitos em diversidade, tornando o alinhamento e a escala simultaneamente difíceis. Apresentamos o Qwen-RobotManip, um modelo fundamental Visão-Linguagem-Ação generalizável construído sobre o Qwen-VL. O Qwen-RobotManip introduz uma estrutura de alinhamento unificada nas dimensões de representação, movimento e comportamental da manipulação, tornando o treinamento multi-fonte em grande escala coerente em vez de conflitante. Essa capacidade de alinhamento, por sua vez, permite que o Qwen-RobotManip absorva dados de manipulação em uma escala que os regimes de treinamento anteriores não conseguiam sustentar. Um pipeline de síntese humano-para-robô converte demonstrações manuais egocêntricas em trajetórias robóticas em 15 plataformas, e um pipeline de curadoria rigorosa harmoniza conjuntos de dados heterogêneos. Usando apenas conjuntos de dados de código aberto e vídeos humanos, sem coleta de dados proprietária, o Qwen-RobotManip constrói um corpus de pré-treinamento de aproximadamente 38.100 horas e exibe capacidades de generalização emergentes, incluindo seguimento de instruções zero-shot, robustez a perturbações, recuperação reativa de erros e transferência entre corporificações. Descobrimos que benchmarks padrão não conseguem capturar a qualidade do pré-treinamento e, em vez disso, adotam configurações OOD, incluindo RoboCasa365, LIBERO-Plus, EBench, RoboTwin-Clean2Rand, RoboTwin-IF e RoboTwin-XE. O Qwen-RobotManip supera substancialmente os modelos de última geração anteriores, incluindo o π0.5, em todas as configurações OOD, classifica-se em 1º no RoboChallenge com uma melhoria relativa de 20% e é validado em plataformas robóticas reais, incluindo AgileX ALOHA, Franka, UR e ARX.
English
Foundation models in language and multimodality achieve strong generalization by aligning heterogeneous data under a unified formulation and training at scale. In this report, we investigate whether this scaling recipe can be applied to robotic manipulation to achieve genuine generalization. This is challenging because, unlike text, manipulation data is heterogeneous by nature, expensive to collect, and narrow in diversity, making alignment and scale simultaneously difficult. We present Qwen-RobotManip, a generalizable Vision-Language-Action foundation model built on Qwen-VL. Qwen-RobotManip introduces a unified alignment framework across the representation, motion, and behavioral dimensions of manipulation, making large-scale multi-source training coherent rather than conflicting. This alignment capability in turn enables Qwen-RobotManip to absorb manipulation data at a scale that prior training regimes could not sustain. A human-to-robot synthesis pipeline converts egocentric hand demonstrations into robot trajectories across 15 platforms, and a rigorous curation pipeline harmonizes heterogeneous datasets. Using only open-source datasets and human videos without proprietary data collection, Qwen-RobotManip constructs a ~38,100-hour pretraining corpus and exhibits emergent generalization capabilities, including zero-shot instruction following, robustness to perturbations, reactive error recovery, and cross-embodiment transfer. We find that standard benchmarks fail to capture pretraining quality and instead adopt OOD settings including RoboCasa365, LIBERO-Plus, EBench, RoboTwin-Clean2Rand, RoboTwin-IF, and RoboTwin-XE. Qwen-RobotManip substantially outperforms prior state-of-the-art models, including π0.5, across all OOD settings, ranks 1st in RoboChallenge with a 20% relative improvement, and is validated on real-robot platforms including AgileX ALOHA, Franka, UR, and ARX.