ChatPaper.aiChatPaper

Xiaomi-Robotics-U0: Унифицированный воплощённый синтез с фундаментальной моделью мира

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

July 13, 2026
Авторы: Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li
cs.AI

Аннотация

Недавние фундаментальные модели генерации изображений и видео обеспечивают сильную обобщаемость и управляемость, но их прямое применение в воплощенных сценариях ограничено требованиями к согласованности множества видов, геометрической связности и ограничениям, связанным с воплощением робота. Существующие методы обычно адаптируют фундаментальные модели с использованием ограниченных данных о роботах, часто жертвуя визуальными знаниями, полученными в ходе крупномасштабного предварительного обучения. Мы представляем Xiaomi-Robotics-U0 — мультимодальную авторегрессионную модель с 38 миллиардами параметров для унифицированного воплощенного синтеза. Она рассматривает воплощенную генерацию как расширение фундаментальной генерации изображений и видео и совместно оптимизирует генерацию текста в изображение, редактирование изображений, генерацию воплощенных сцен, воплощенный перенос и генерацию воплощенного видео. Эта унифицированная структура сохраняет обобщаемость предварительно обученной фундаментальной модели мира, адаптируя ее к воплощенным условиям. Xiaomi-Robotics-U0 — первая модель, которая поддерживает высококачественную генерацию сцен с множества видов для различных воплощений роботов и вводит структурированный управляемый воплощенный перенос для тонкодетализированного редактирования с сохранением согласованности множества видов и динамики взаимодействия. Она достигает современных результатов на задачах одношаговой и последовательной генерации, превосходя GPT-Image-2.0 в человеческих оценках воплощенной генерации сцен и переноса, занимая первое место в World Arena по воплощенной генерации видео и повышая показатель успешности вне распределения для pi_0.5 с 36,9% до 63,2% в сложных задачах манипуляции в реальном мире. Эти результаты показывают, что фундаментальные модели мира могут служить как воплощенными моделями мира, так и масштабируемыми движками данных для воплощенного интеллекта. Код и контрольные точки доступны по адресу https://robotics.xiaomi.com/xiaomi-robotics-u0.html.
English
Recent foundation image and video generation models offer strong generalization and controllability, but their direct application to embodied scenarios is limited by requirements for multi-view consistency, geometric coherence, and robot embodiment constraints. Existing methods typically adapt foundation models with limited robot data, often sacrificing visual knowledge acquired during large-scale pre-training. We present Xiaomi-Robotics-U0, a 38-billion-parameter multimodal autoregressive model for unified embodied synthesis. It treats embodied generation as an extension of foundation image and video generation and jointly optimizes text-to-image generation, image editing, embodied scene generation, embodied transfer, and embodied video generation. This unified framework preserves the generalization of the pre-trained world foundation model while adapting it to embodied settings. Xiaomi-Robotics-U0 is the first model to support high-quality multi-view scene generation across multiple robot embodiments and to introduce structured, controllable embodied transfer for fine-grained editing while preserving multi-view consistency and interaction dynamics. It achieves state-of-the-art results on single-step and sequential generation tasks, outperforming GPT-Image-2.0 in human evaluations of embodied scene generation and transfer, ranking first on World Arena for embodied video generation, and improving the out-of-distribution success rate of pi_0.5 from 36.9% to 63.2% on challenging real-world manipulation tasks. These results show that foundation world models can serve both as embodied world models and scalable data engines for embodied intelligence. Code and checkpoints are available at https://robotics.xiaomi.com/xiaomi-robotics-u0.html.