RynnWorld-Teleop: Модель мира, обусловленная действиями, для цифровой телеоперации
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
July 7, 2026
Авторы: Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
cs.AI
Аннотация
Масштабирование обучения роботов требует огромных и разнообразных наборов данных траекторий, однако в настоящее время их сбор ограничен физической телеоперацией, при которой каждая демонстрация привязывает время оператора к конкретному оборудованию и рабочим пространствам. Мы представляем цифровую телеоперацию — парадигму, которая устраняет зависимость сбора данных от физических ограничений, заменяя реального робота генеративной моделью мира. В этом подходе поток жестов руки оператора управляет роботоцентрической генеративной моделью мира, синтезирующей высококачественные эгоцентрические видео на основе одного эталонного изображения. Записанный поток жестов служит меткой действия, независимой от воплощения (embodiment-agnostic) и переносимой на любого целевого робота с помощью стандартного ретаргетинга, что даёт полные траектории «состояние-действие» для обучения имитации без привязки к физическому оборудованию. Мы реализуем эту парадигму в системе RynnWorld-Teleop, которая объединяет скелетное кондиционирование с учётом глубины, прогрессивное обучение типа «человек-робот» на видеотрансформере диффузии и потоковую авторегрессионную дистилляцию. Этот конвейер сжимает генеративный процесс в однопроходный вывод, обеспечивая интерактивную генерацию в реальном времени на одном графическом процессоре H100 с частотой более 40 кадров в секунду. Политики, обученные исключительно на данных, сгенерированных RynnWorld-Teleop, достигают эффективного нулевого переноса из симуляции в реальность (zero-shot Sim2Real) для разнообразных двуручных задач, требующих ловкости. Более того, дополнение наборов реальных данных нашими цифровыми телеоперационными данными последовательно повышает показатели успешности, что демонстрирует, что RynnWorld-Teleop служит высококачественным, масштабируемым механизмом генерации данных для следующего поколения роботизированных агентов.
English
Scaling robot learning requires massive, diverse trajectory data, yet collection is currently bottlenecked by physical teleoperation, where every demonstration binds operator time to specific hardware and workspaces. We introduce digital teleoperation, a paradigm that decouples data collection from physical constraints by replacing the real robot with a generative world model. In this framework, an operator's hand-pose stream drives a robot-centric generative world model to synthesize high-fidelity egocentric videos from a single reference image. The recorded pose stream serves as an embodiment-agnostic action label transferable to any target robot via standard retargeting, yielding complete state-action trajectories for imitation learning independent of physical hardware. We instantiate this paradigm in RynnWorld-Teleop, a system that integrates depth-aware skeletal conditioning, progressive human-to-robot training on a video Diffusion Transformer, and streaming autoregressive distillation. This pipeline compresses the generative process into a single-pass inference, enabling 40+ FPS, real-time interactive generation on a single H100 GPU. Policies trained exclusively on RynnWorld-Teleop-generated data achieve effective zero-shot Sim2Real transfer across dexterous and diverse bimanual tasks. Moreover, augmenting real-world datasets with our digitally teleoperated data consistently improves success rates, demonstrating that RynnWorld-Teleop serves as a high-fidelity, scalable data engine for the next generation of robotic agents.