RynnWorld-Teleop: Un Modelo de Mundo Condicionado por Acciones para Teleoperación Digital
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
July 7, 2026
Autores: Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
cs.AI
Resumen
El escalado del aprendizaje robótico requiere datos de trayectorias masivos y diversos, pero su recolección actualmente está limitada por la teleoperación física, donde cada demostración vincula el tiempo del operador a hardware y espacios de trabajo específicos. Presentamos la teleoperación digital, un paradigma que desacopla la recolección de datos de las restricciones físicas al reemplazar el robot real por un modelo generativo del mundo. En este marco, el flujo de la pose de la mano del operador impulsa un modelo generativo del mundo centrado en el robot para sintetizar videos egocéntricos de alta fidelidad a partir de una única imagen de referencia. El flujo de pose registrado sirve como una etiqueta de acción independiente de la morfología, transferible a cualquier robot objetivo mediante reorientación estándar, generando trayectorias completas de estado-acción para aprendizaje por imitación sin depender de hardware físico. Concretamos este paradigma en RynnWorld-Teleop, un sistema que integra condicionamiento esquelético consciente de la profundidad, entrenamiento progresivo humano a robot sobre un Transformer de difusión de video y destilación autorregresiva en streaming. Este pipeline comprime el proceso generativo en una inferencia de una sola pasada, logrando una generación interactiva en tiempo real a más de 40 FPS en una sola GPU H100. Las políticas entrenadas exclusivamente con datos generados por RynnWorld-Teleop logran una transferencia Sim2Real zero-shot efectiva en tareas bimanuales diestras y diversas. Además, aumentar conjuntos de datos del mundo real con nuestros datos teleoperados digitalmente mejora consistentemente las tasas de éxito, demostrando que RynnWorld-Teleop funciona como un motor de datos escalable y de alta fidelidad para la próxima generación de agentes robóticos.
English
Scaling robot learning requires massive, diverse trajectory data, yet collection is currently bottlenecked by physical teleoperation, where every demonstration binds operator time to specific hardware and workspaces. We introduce digital teleoperation, a paradigm that decouples data collection from physical constraints by replacing the real robot with a generative world model. In this framework, an operator's hand-pose stream drives a robot-centric generative world model to synthesize high-fidelity egocentric videos from a single reference image. The recorded pose stream serves as an embodiment-agnostic action label transferable to any target robot via standard retargeting, yielding complete state-action trajectories for imitation learning independent of physical hardware. We instantiate this paradigm in RynnWorld-Teleop, a system that integrates depth-aware skeletal conditioning, progressive human-to-robot training on a video Diffusion Transformer, and streaming autoregressive distillation. This pipeline compresses the generative process into a single-pass inference, enabling 40+ FPS, real-time interactive generation on a single H100 GPU. Policies trained exclusively on RynnWorld-Teleop-generated data achieve effective zero-shot Sim2Real transfer across dexterous and diverse bimanual tasks. Moreover, augmenting real-world datasets with our digitally teleoperated data consistently improves success rates, demonstrating that RynnWorld-Teleop serves as a high-fidelity, scalable data engine for the next generation of robotic agents.