ChatPaper.aiChatPaper

RynnWorld-4D: Modelos Mundiais Corporificados 4D para Manipulação Robótica

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

July 7, 2026
Autores: Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
cs.AI

Resumo

A manipulação robótica no mundo aberto requer não apenas reconhecer a aparência de uma cena, mas também antecipar como sua estrutura 3D se move sob interação. Argumentamos que RGB, profundidade e fluxo óptico sincronizados, ou seja, RGB-DF, fornecem uma representação fisicamente fundamentada que captura a dinâmica 4D subjacente de uma cena. Em comparação com vídeos de pixels 2D, essa sinergia multimodal alinha a aparência visual com a estrutura geométrica e o movimento temporal, criando um espaço de representação significativamente mais próximo das ações de baixo nível do atuador final exigidas por sistemas robóticos, reduzindo assim a lacuna entre a previsão do mundo e o aprendizado de políticas. Com base nessa percepção, introduzimos o RynnWorld-4D, um modelo generativo que co-produz quadros RGB futuros, mapas de profundidade e fluxo óptico a partir de uma única imagem RGB-D e uma instrução em linguagem, dentro de um único processo de difusão unificado. Este modelo de mundo 4D apresenta uma arquitetura de três ramificações que integra atenção cross-modal com RoPE 3D por quadro, garantindo que aparência, geometria e movimento evoluam de forma consistente. Para fornecer dados de treinamento em escala, curamos o Rynn4DDataset 1.0, um conjunto massivo de mais de 254,4 milhões de quadros de vídeos egocêntricos de manipulação humana e robótica, com pseudo-rótulos de alta qualidade para profundidade e fluxo óptico. Propomos ainda o RynnWorld-4D-Policy, uma cabeça de dinâmica inversa que consome as representações 4D internas do RynnWorld-4D em uma única passagem direta, contornando a desruificação multi-etapas dispendiosa, para gerar ações do robô em malha fechada. Experimentos mostram que o RynnWorld-4D produz previsões 4D temporal e espacialmente coerentes, e que o RynnWorld-4D-Policy atinge desempenho de ponta em tarefas reais de manipulação bimanual hábil, destacando-se particularmente em tarefas que exigem precisão espacial e coordenação temporal.
English
Robotic manipulation in the open world requires not only recognizing what a scene looks like, but also anticipating how its 3D structure moves under interaction. We argue that synchronized RGB, depth, and optical flow, namely RGB-DF, provide a physically grounded representation that captures the underlying 4D dynamics of a scene. Compared to 2D pixel videos, this multi-modal synergy aligns visual appearance with geometric structure and temporal motion, creating a representation space significantly closer to the low-level end-effector actions demanded by robotic systems, thereby narrowing the gap between world prediction and policy learning. Building on this insight, we introduce RynnWorld-4D, a generative model that co-produces future RGB frames, depth maps, and optical flow from a single RGB-D image and a language instruction within one unified diffusion process. This 4D world model features a tri-branch architecture that integrates cross-modal attention with frame-wise 3D RoPE, ensuring that appearance, geometry, and motion evolve consistently. To supply training data at scale, we curate Rynn4DDataset 1.0, a massive dataset of over 254.4 million frames across egocentric human and robotic manipulation videos with high-quality pseudo-labels for depth and optical flow. We further propose RynnWorld-4D-Policy, an inverse dynamics head that consumes the internal 4D representations of RynnWorld-4D in a single forward pass, bypassing expensive multi-step denoising, to output robot actions in a closed-loop manner. Experiments show that RynnWorld-4D produces temporally and spatially coherent 4D predictions, and that RynnWorld-4D-Policy achieves state-of-the-art performance on real-world dexterous bimanual manipulation tasks, particularly excelling in tasks demanding spatial precision and temporal coordination.