ChatPaper.aiChatPaper

Overdracht als overbruggende handeling: het overdragen van manipulatievaardigheden van mensen naar robots

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

June 26, 2026
Auteurs: Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu
cs.AI

Samenvatting

Wij onderzoeken of we nieuwe manipulatievaardigheden van menselijke acties kunnen overdragen naar een tweehandige robot met parallelle grijpers. Menselijke actiedata is goedkoop, overvloedig en divers, waardoor het een van de meest veelbelovende bronnen is voor het opschalen van robotleren. Toch blijft het overbrengen van vaardigheden van mensen naar robots lastig: het meeste eerdere werk beschouwt mensen als slechts een andere tweehandige 6DoF-embodiment, waarbij handpositieschattingen ruisachtig zijn en de contactpatronen van menselijke vingers fundamenteel verschillen van die van een parallelle grijper. Wij stellen daarom dat het leren van rotatie-inclusieve actiesignalen uit menselijke data suboptimaal is, en stellen in plaats daarvan een overbruggende actierepresentatie voor: de relatieve polstranslatie binnen het initiële hoofdcameraframe, een actieruimte die gedeeld wordt door mens en robot. Om de mogelijke afwezigheid van bepaalde actiecomponenten in verschillende embodiments te hanteren, bouwen we een π₀-achtig visie-taal-actiemodel met afgewisselde actietokens en aandachtmaskering. Op een reeks nieuwe tweehandige manipulatie taken brengt onze overbruggende actie menselijke manipulatiekennis veel effectiever over dan ruizige 6DoF-menselijke acties en schaalt deze met de hoeveelheid menselijke data.
English
We study whether we can learn novel manipulation skills from human actions to a bi-manual robot with parallel grippers. Human action data is cheap, abundant, and diverse, making it one of the most promising resources for scaling up robot learning. Yet transferring skills from humans to robots remains hard: most prior work treats humans as just another bi-manual 6DoF embodiment, where hand-pose estimates are noisy and the contact patterns of human fingers differ fundamentally from those of a parallel gripper. We argue that learning rotation-inclusive action signals from human data is therefore sub-optimal, and instead propose a bridging action representation: the relative wrist translation within the initial head-camera frame, an action space shared by humans and robots. To handle the potential absence of certain action components in different embodiments, we build a π_0-like vision-language-action model with interleaved action tokens and attention masking. On a suite of novel bi-manual manipulation tasks, our bridging action transfers human manipulation knowledge to robots far more effectively than noisy 6DoF human actions and scales with the amount of human data.