ChatPaper.aiChatPaper

RynnWorld-Teleop: Een actie-geconditioneerd wereldmodel voor digitale teleoperatie

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

July 7, 2026
Auteurs: Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
cs.AI

Samenvatting

Het opschalen van robotleren vereist enorme, diverse trajectoriadata, maar de verzameling ervan wordt momenteel gefleste door fysieke teleoperatie, waarbij elke demonstratie de tijd van de operator bindt aan specifieke hardware en werkruimtes. We introduceren digitale teleoperatie, een paradigma dat datacollectie ontkoppelt van fysieke beperkingen door de echte robot te vervangen door een generatief wereldmodel. In dit kader stuurt de handpositie-stroom van een operator een robot-centrisch generatief wereldmodel aan om hoogwaardige egocentrische video's te synthetiseren vanuit één enkel referentiebeeld. De geregistreerde positiestroom dient als een belichaamings-agnostische actielabel die via standaard retargeting naar elke doelrobot kan worden overgedragen, wat levert volledige toestand-actie-trajectorieën voor imitatieleer onafhankelijk van fysieke hardware. We concretiseren dit paradigma in RynnWorld-Teleop, een systeem dat dieptebewuste skeletconditionering, progressieve mens-naar-robottraining op een video-diffusietransformator en streaming autoregressieve distillatie integreert. Deze pijplijn comprimeert het generatieve proces tot een eenmalige inferentie, waardoor 40+ FPS, real-time interactieve generatie op een enkele H100-GPU mogelijk wordt. Beleid dat uitsluitend is getraind op door RynnWorld-Teleop gegenereerde data, behaalt effectieve zero-shot Sim2Real-overdracht voor behendige en diverse bimanuele taken. Bovendien verhoogt het aanvullen van real-world datasets met onze digitaal teleoperatie gegenereerde data consequent de slagingspercentages, wat aantoont dat RynnWorld-Teleop fungeert als een hoogwaardige, schaalbare data-engine voor de volgende generatie robotische agenten.
English
Scaling robot learning requires massive, diverse trajectory data, yet collection is currently bottlenecked by physical teleoperation, where every demonstration binds operator time to specific hardware and workspaces. We introduce digital teleoperation, a paradigm that decouples data collection from physical constraints by replacing the real robot with a generative world model. In this framework, an operator's hand-pose stream drives a robot-centric generative world model to synthesize high-fidelity egocentric videos from a single reference image. The recorded pose stream serves as an embodiment-agnostic action label transferable to any target robot via standard retargeting, yielding complete state-action trajectories for imitation learning independent of physical hardware. We instantiate this paradigm in RynnWorld-Teleop, a system that integrates depth-aware skeletal conditioning, progressive human-to-robot training on a video Diffusion Transformer, and streaming autoregressive distillation. This pipeline compresses the generative process into a single-pass inference, enabling 40+ FPS, real-time interactive generation on a single H100 GPU. Policies trained exclusively on RynnWorld-Teleop-generated data achieve effective zero-shot Sim2Real transfer across dexterous and diverse bimanual tasks. Moreover, augmenting real-world datasets with our digitally teleoperated data consistently improves success rates, demonstrating that RynnWorld-Teleop serves as a high-fidelity, scalable data engine for the next generation of robotic agents.