Tradução como Ação de Ponte: Transferência de Habilidades de Manipulação de Humanos para Robôs
Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots
June 26, 2026
Autores: Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu
cs.AI
Resumo
Estudamos se é possível aprender habilidades de manipulação inéditas a partir de ações humanas para um robô bimanual com garras paralelas. Dados de ações humanas são baratos, abundantes e diversos, o que os torna um dos recursos mais promissores para escalar o aprendizado robótico. No entanto, transferir habilidades de humanos para robôs continua sendo desafiador: a maioria dos trabalhos anteriores trata humanos como apenas mais uma corporificação bimanual de 6 graus de liberdade (6DoF), onde as estimativas de pose da mão são ruidosas e os padrões de contato dos dedos humanos diferem fundamentalmente daqueles de uma garra paralela. Argumentamos que aprender sinais de ação que incluem rotação a partir de dados humanos é, portanto, subótimo e, em vez disso, propomos uma representação de ação de ponte: a translação relativa do punho no referencial inicial da câmera na cabeça, um espaço de ação compartilhado por humanos e robôs. Para lidar com a possível ausência de certos componentes de ação em diferentes corporificações, construímos um modelo visão-linguagem-ação semelhante ao π_0, com tokens de ação intercalados e mascaramento de atenção. Em um conjunto de tarefas inéditas de manipulação bimanual, nossa ação de ponte transfere conhecimento de manipulação humana para robôs de forma muito mais eficaz do que ações humanas ruidosas de 6DoF e escala com a quantidade de dados humanos.
English
We study whether we can learn novel manipulation skills from human actions to a bi-manual robot with parallel grippers. Human action data is cheap, abundant, and diverse, making it one of the most promising resources for scaling up robot learning. Yet transferring skills from humans to robots remains hard: most prior work treats humans as just another bi-manual 6DoF embodiment, where hand-pose estimates are noisy and the contact patterns of human fingers differ fundamentally from those of a parallel gripper. We argue that learning rotation-inclusive action signals from human data is therefore sub-optimal, and instead propose a bridging action representation: the relative wrist translation within the initial head-camera frame, an action space shared by humans and robots. To handle the potential absence of certain action components in different embodiments, we build a π_0-like vision-language-action model with interleaved action tokens and attention masking. On a suite of novel bi-manual manipulation tasks, our bridging action transfers human manipulation knowledge to robots far more effectively than noisy 6DoF human actions and scales with the amount of human data.