ChatPaper.aiChatPaper

RynnWorld-Teleop : Un modèle du monde conditionné par l’action pour la téléopération numérique

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

July 7, 2026
Auteurs: Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
cs.AI

Résumé

L'apprentissage robotique à grande échelle nécessite des données de trajectoire massives et diverses, mais la collecte est actuellement limitée par la téléopération physique, où chaque démonstration lie le temps de l'opérateur à un matériel et des espaces de travail spécifiques. Nous introduisons la téléopération numérique, un paradigme qui dissocie la collecte de données des contraintes physiques en remplaçant le robot réel par un modèle génératif du monde. Dans ce cadre, le flux de poses de la main d'un opérateur pilote un modèle génératif du monde centré sur le robot pour synthétiser des vidéos égocentriques de haute fidélité à partir d'une seule image de référence. Le flux de poses enregistré sert d'étiquette d'action indépendante de l'incarnation, transférable à tout robot cible via un reciblage standard, produisant des trajectoires état-action complètes pour l'apprentissage par imitation, indépendamment du matériel physique. Nous concrétisons ce paradigme dans RynnWorld-Teleop, un système qui intègre le conditionnement squelettique conscient de la profondeur, l'entraînement progressif humain-robot sur un Transformer de diffusion vidéo, et la distillation autorégressive en continu. Ce pipeline comprime le processus génératif en une inférence en un seul passage, permettant une génération interactive en temps réel à plus de 40 images par seconde sur un seul GPU H100. Les politiques entraînées exclusivement sur des données générées par RynnWorld-Teleop réalisent un transfert Sim2Real zero-shot efficace pour des tâches bimanuelles dextres et diverses. De plus, l'augmentation des ensembles de données réelles avec nos données téléopérées numériquement améliore systématiquement les taux de succès, démontrant que RynnWorld-Teleop sert de moteur de données haute-fidélité et évolutif pour la prochaine génération d'agents robotiques.
English
Scaling robot learning requires massive, diverse trajectory data, yet collection is currently bottlenecked by physical teleoperation, where every demonstration binds operator time to specific hardware and workspaces. We introduce digital teleoperation, a paradigm that decouples data collection from physical constraints by replacing the real robot with a generative world model. In this framework, an operator's hand-pose stream drives a robot-centric generative world model to synthesize high-fidelity egocentric videos from a single reference image. The recorded pose stream serves as an embodiment-agnostic action label transferable to any target robot via standard retargeting, yielding complete state-action trajectories for imitation learning independent of physical hardware. We instantiate this paradigm in RynnWorld-Teleop, a system that integrates depth-aware skeletal conditioning, progressive human-to-robot training on a video Diffusion Transformer, and streaming autoregressive distillation. This pipeline compresses the generative process into a single-pass inference, enabling 40+ FPS, real-time interactive generation on a single H100 GPU. Policies trained exclusively on RynnWorld-Teleop-generated data achieve effective zero-shot Sim2Real transfer across dexterous and diverse bimanual tasks. Moreover, augmenting real-world datasets with our digitally teleoperated data consistently improves success rates, demonstrating that RynnWorld-Teleop serves as a high-fidelity, scalable data engine for the next generation of robotic agents.