ChatPaper.aiChatPaper

RynnWorld-4D: 4D воплощенные модели мира для роботизированной манипуляции

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

July 7, 2026
Авторы: Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
cs.AI

Аннотация

Роботизированное манипулирование в открытом мире требует не только распознавания внешнего вида сцены, но и предвидения того, как ее трехмерная структура изменяется при взаимодействии. Мы утверждаем, что синхронизированные RGB, глубина и оптический поток, а именно RGB-DF, обеспечивают физически обоснованное представление, которое отражает нижележащую 4D-динамику сцены. По сравнению с 2D-пиксельными видео, эта мультимодальная синергия согласует визуальный облик с геометрической структурой и временным движением, создавая пространство представления, значительно более близкое к низкоуровневым действиям конечного исполнителя, требуемым робототехническими системами, тем самым сокращая разрыв между предсказанием мира и обучением политике. Основываясь на этом понимании, мы представляем RynnWorld-4D — генеративную модель, которая в рамках единого процесса диффузии совместно производит будущие RGB-кадры, карты глубины и оптический поток на основе одного RGB-D изображения и текстовой инструкции. Эта 4D-модель мира содержит архитектуру с тремя ветвями, которая интегрирует межмодальное внимание с покадровой 3D-позицией RoPE, обеспечивая согласованную эволюцию облика, геометрии и движения. Для обеспечения данных для обучения в масштабе мы подготовили Rynn4DDataset 1.0 — обширный набор данных, включающий более 254.4 миллионов кадров из эгоцентрических видео с участием человека и роботов, со высококачественными псевдометками глубины и оптического потока. Мы также предлагаем RynnWorld-4D-Policy — головку обратной динамики, которая потребляет внутренние 4D-представления RynnWorld-4D за один прямой проход, обходя дорогостоящее многошаговое шумоподавление, чтобы выдавать действия робота в режиме замкнутого цикла. Эксперименты показывают, что RynnWorld-4D создает темпорально и пространственно согласованные 4D-предсказания, а RynnWorld-4D-Policy достигает передовой производительности в реальных задачах ловкого двуручного манипулирования, особенно преуспевая в задачах, требующих пространственной точности и временной координации.
English
Robotic manipulation in the open world requires not only recognizing what a scene looks like, but also anticipating how its 3D structure moves under interaction. We argue that synchronized RGB, depth, and optical flow, namely RGB-DF, provide a physically grounded representation that captures the underlying 4D dynamics of a scene. Compared to 2D pixel videos, this multi-modal synergy aligns visual appearance with geometric structure and temporal motion, creating a representation space significantly closer to the low-level end-effector actions demanded by robotic systems, thereby narrowing the gap between world prediction and policy learning. Building on this insight, we introduce RynnWorld-4D, a generative model that co-produces future RGB frames, depth maps, and optical flow from a single RGB-D image and a language instruction within one unified diffusion process. This 4D world model features a tri-branch architecture that integrates cross-modal attention with frame-wise 3D RoPE, ensuring that appearance, geometry, and motion evolve consistently. To supply training data at scale, we curate Rynn4DDataset 1.0, a massive dataset of over 254.4 million frames across egocentric human and robotic manipulation videos with high-quality pseudo-labels for depth and optical flow. We further propose RynnWorld-4D-Policy, an inverse dynamics head that consumes the internal 4D representations of RynnWorld-4D in a single forward pass, bypassing expensive multi-step denoising, to output robot actions in a closed-loop manner. Experiments show that RynnWorld-4D produces temporally and spatially coherent 4D predictions, and that RynnWorld-4D-Policy achieves state-of-the-art performance on real-world dexterous bimanual manipulation tasks, particularly excelling in tasks demanding spatial precision and temporal coordination.