ChatPaper.aiChatPaper

RynnWorld-4D : Modèles du monde incarnés en 4D pour la manipulation robotique

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

July 7, 2026
Auteurs: Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
cs.AI

Résumé

La manipulation robotique dans le monde ouvert nécessite non seulement de reconnaître l'apparence d'une scène, mais aussi d'anticiper comment sa structure 3D se déplace sous l'effet d'interactions. Nous soutenons que la synchronisation des données RVB, de profondeur et de flux optique, nommée RVB-PF (RGB-DF), offre une représentation physiquement ancrée qui capture la dynamique 4D sous-jacente d'une scène. Comparée aux vidéos en pixels 2D, cette synergie multimodale aligne l'apparence visuelle avec la structure géométrique et le mouvement temporel, créant un espace de représentation significativement plus proche des actions de l'effecteur terminal de bas niveau requises par les systèmes robotiques, réduisant ainsi l'écart entre la prédiction du monde et l'apprentissage de politiques. Forts de cette intuition, nous introduisons RynnWorld-4D, un modèle génératif qui coproduit des images RVB futures, des cartes de profondeur et des flux optiques à partir d'une seule image RVB-D et d'une instruction langagière au sein d'un unique processus de diffusion unifié. Ce modèle du monde 4D possède une architecture à trois branches qui intègre une attention cross-modale avec une RoPE 3D par trame, garantissant que l'apparence, la géométrie et le mouvement évoluent de manière cohérente. Pour fournir des données d'entraînement à grande échelle, nous élaborons Rynn4DDataset 1.0, un ensemble de données massif de plus de 254,4 millions de trames issues de vidéos de manipulation humaines et robotiques égocentriques, accompagnées de pseudo-étiquettes de haute qualité pour la profondeur et le flux optique. Nous proposons également RynnWorld-4D-Policy, une tête de dynamique inverse qui consomme les représentations 4D internes de RynnWorld-4D en un seul passage avant, contournant le débruyage multi-étapes coûteux, pour produire des actions robotiques en boucle fermée. Les expériences montrent que RynnWorld-4D génère des prédictions 4D temporellement et spatialement cohérentes, et que RynnWorld-4D-Policy atteint des performances de pointe sur des tâches de manipulation bimanuelle dextre réelles, excellant particulièrement dans les tâches exigeant une précision spatiale et une coordination temporelle.
English
Robotic manipulation in the open world requires not only recognizing what a scene looks like, but also anticipating how its 3D structure moves under interaction. We argue that synchronized RGB, depth, and optical flow, namely RGB-DF, provide a physically grounded representation that captures the underlying 4D dynamics of a scene. Compared to 2D pixel videos, this multi-modal synergy aligns visual appearance with geometric structure and temporal motion, creating a representation space significantly closer to the low-level end-effector actions demanded by robotic systems, thereby narrowing the gap between world prediction and policy learning. Building on this insight, we introduce RynnWorld-4D, a generative model that co-produces future RGB frames, depth maps, and optical flow from a single RGB-D image and a language instruction within one unified diffusion process. This 4D world model features a tri-branch architecture that integrates cross-modal attention with frame-wise 3D RoPE, ensuring that appearance, geometry, and motion evolve consistently. To supply training data at scale, we curate Rynn4DDataset 1.0, a massive dataset of over 254.4 million frames across egocentric human and robotic manipulation videos with high-quality pseudo-labels for depth and optical flow. We further propose RynnWorld-4D-Policy, an inverse dynamics head that consumes the internal 4D representations of RynnWorld-4D in a single forward pass, bypassing expensive multi-step denoising, to output robot actions in a closed-loop manner. Experiments show that RynnWorld-4D produces temporally and spatially coherent 4D predictions, and that RynnWorld-4D-Policy achieves state-of-the-art performance on real-world dexterous bimanual manipulation tasks, particularly excelling in tasks demanding spatial precision and temporal coordination.