RynnWorld-Teleop: Um Modelo do Mundo Condicionado por Ações para Teleoperação Digital
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
July 7, 2026
Autores: Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
cs.AI
Resumo
O escalonamento da aprendizagem robótica exige dados massivos e diversificados de trajetórias, mas a coleta atualmente é limitada pela teleoperação física, onde cada demonstração vincula o tempo do operador a um hardware e espaços de trabalho específicos. Apresentamos a teleoperação digital, um paradigma que desacopla a coleta de dados das restrições físicas ao substituir o robô real por um modelo generativo de mundo. Nesse arcabouço, o fluxo de poses da mão de um operador guia um modelo generativo de mundo centrado no robô para sintetizar vídeos egocêntricos de alta fidelidade a partir de uma única imagem de referência. O fluxo de poses registrado serve como um rótulo de ação independente de corporificação, transferível para qualquer robô alvo via redirecionamento padrão, gerando trajetórias completas de estado-ação para aprendizagem por imitação, independentes de hardware físico. Instanciamos esse paradigma no RynnWorld-Teleop, um sistema que integra condicionamento esquelético consciente de profundidade, treinamento progressivo humano-para-robô em um Transformador de Difusão de Vídeo e destilação autoregressiva em fluxo contínuo. Este pipeline comprime o processo generativo em uma inferência de passagem única, permitindo geração interativa em tempo real a 40+ FPS em uma única GPU H100. Políticas treinadas exclusivamente com dados gerados pelo RynnWorld-Teleop alcançam transferência Sim2Real zero-shot eficaz em tarefas bimanuais diversas e hábeis. Além disso, a ampliação de conjuntos de dados do mundo real com nossos dados teleoperados digitalmente melhora consistentemente as taxas de sucesso, demonstrando que o RynnWorld-Teleop serve como um motor de dados escalável e de alta fidelidade para a próxima geração de agentes robóticos.
English
Scaling robot learning requires massive, diverse trajectory data, yet collection is currently bottlenecked by physical teleoperation, where every demonstration binds operator time to specific hardware and workspaces. We introduce digital teleoperation, a paradigm that decouples data collection from physical constraints by replacing the real robot with a generative world model. In this framework, an operator's hand-pose stream drives a robot-centric generative world model to synthesize high-fidelity egocentric videos from a single reference image. The recorded pose stream serves as an embodiment-agnostic action label transferable to any target robot via standard retargeting, yielding complete state-action trajectories for imitation learning independent of physical hardware. We instantiate this paradigm in RynnWorld-Teleop, a system that integrates depth-aware skeletal conditioning, progressive human-to-robot training on a video Diffusion Transformer, and streaming autoregressive distillation. This pipeline compresses the generative process into a single-pass inference, enabling 40+ FPS, real-time interactive generation on a single H100 GPU. Policies trained exclusively on RynnWorld-Teleop-generated data achieve effective zero-shot Sim2Real transfer across dexterous and diverse bimanual tasks. Moreover, augmenting real-world datasets with our digitally teleoperated data consistently improves success rates, demonstrating that RynnWorld-Teleop serves as a high-fidelity, scalable data engine for the next generation of robotic agents.