RynnWorld-4D: Modelos de Mundo 4D Encarnados para Manipulación Robótica
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
July 7, 2026
Autores: Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
cs.AI
Resumen
La manipulación robótica en el mundo abierto no solo requiere reconocer la apariencia de una escena, sino también anticipar cómo se mueve su estructura 3D bajo interacción. Argumentamos que la información sincronizada de RGB, profundidad y flujo óptico, denominada RGB-DF, proporciona una representación fundamentada físicamente que captura la dinámica 4D subyacente de una escena. En comparación con los videos de píxeles 2D, esta sinergia multimodal alinea la apariencia visual con la estructura geométrica y el movimiento temporal, creando un espacio de representación significativamente más cercano a las acciones de bajo nivel del efector final requeridas por los sistemas robóticos, reduciendo así la brecha entre la predicción del mundo y el aprendizaje de políticas. Basándonos en esta idea, presentamos RynnWorld-4D, un modelo generativo que coproduce futuros fotogramas RGB, mapas de profundidad y flujo óptico a partir de una única imagen RGB-D y una instrucción en lenguaje natural dentro de un único proceso de difusión unificado. Este modelo de mundo 4D cuenta con una arquitectura de tres ramas que integra atención intermodal con RoPE 3D por fotograma, asegurando que la apariencia, la geometría y el movimiento evolucionen de manera coherente. Para proporcionar datos de entrenamiento a escala, curamos Rynn4DDataset 1.0, un conjunto de datos masivo de más de 254,4 millones de fotogramas de videos de manipulación humana y robótica en primera persona, con pseudoetiquetas de alta calidad para profundidad y flujo óptico. Proponemos además RynnWorld-4D-Policy, una cabeza de dinámica inversa que consume las representaciones internas 4D de RynnWorld-4D en una sola pasada hacia adelante, evitando el costoso proceso de eliminación de ruido en múltiples pasos, para generar acciones del robot en un bucle cerrado. Los experimentos muestran que RynnWorld-4D produce predicciones 4D temporal y espacialmente coherentes, y que RynnWorld-4D-Policy alcanza un rendimiento de vanguardia en tareas de manipulación bimanual diestra en el mundo real, destacando especialmente en tareas que exigen precisión espacial y coordinación temporal.
English
Robotic manipulation in the open world requires not only recognizing what a scene looks like, but also anticipating how its 3D structure moves under interaction. We argue that synchronized RGB, depth, and optical flow, namely RGB-DF, provide a physically grounded representation that captures the underlying 4D dynamics of a scene. Compared to 2D pixel videos, this multi-modal synergy aligns visual appearance with geometric structure and temporal motion, creating a representation space significantly closer to the low-level end-effector actions demanded by robotic systems, thereby narrowing the gap between world prediction and policy learning. Building on this insight, we introduce RynnWorld-4D, a generative model that co-produces future RGB frames, depth maps, and optical flow from a single RGB-D image and a language instruction within one unified diffusion process. This 4D world model features a tri-branch architecture that integrates cross-modal attention with frame-wise 3D RoPE, ensuring that appearance, geometry, and motion evolve consistently. To supply training data at scale, we curate Rynn4DDataset 1.0, a massive dataset of over 254.4 million frames across egocentric human and robotic manipulation videos with high-quality pseudo-labels for depth and optical flow. We further propose RynnWorld-4D-Policy, an inverse dynamics head that consumes the internal 4D representations of RynnWorld-4D in a single forward pass, bypassing expensive multi-step denoising, to output robot actions in a closed-loop manner. Experiments show that RynnWorld-4D produces temporally and spatially coherent 4D predictions, and that RynnWorld-4D-Policy achieves state-of-the-art performance on real-world dexterous bimanual manipulation tasks, particularly excelling in tasks demanding spatial precision and temporal coordination.