ChatPaper.aiChatPaper

Xiaomi-Robotics-U0 : Synthèse unifiée incarnée avec un modèle de fondation du monde

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

July 13, 2026
Auteurs: Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li
cs.AI

Résumé

Les récents modèles de génération d'images et de vidéos fondateurs offrent une forte généralisation et une grande contrôlabilité, mais leur application directe à des scénarios incarnés est limitée par les exigences de cohérence multi-vue, de cohérence géométrique et de contraintes liées à l'incarnation robotique. Les méthodes existantes adaptent généralement ces modèles fondateurs avec des données robotiques limitées, sacrifiant souvent les connaissances visuelles acquises lors du pré-entraînement à grande échelle. Nous présentons Xiaomi-Robotics-U0, un modèle autorégressif multimodal de 38 milliards de paramètres pour une synthèse incarnée unifiée. Il traite la génération incarnée comme une extension de la génération d'images et de vidéos fondatrice et optimise conjointement la génération texte-à-image, l'édition d'images, la génération de scènes incarnées, le transfert incarné et la génération de vidéos incarnées. Ce cadre unifié préserve la généralisation du modèle de monde fondateur pré-entraîné tout en l'adaptant aux contextes incarnés. Xiaomi-Robotics-U0 est le premier modèle à prendre en charge la génération de scènes multi-vue de haute qualité à travers de multiples incarnations robotiques et à introduire un transfert incarné structuré et contrôlable pour une édition fine tout en préservant la cohérence multi-vue et la dynamique d'interaction. Il atteint des résultats de pointe sur des tâches de génération en une seule étape et séquentielles, surpassant GPT-Image-2.0 dans les évaluations humaines de la génération et du transfert de scènes incarnées, se classant premier sur World Arena pour la génération de vidéos incarnées, et améliorant le taux de réussite hors distribution de pi_0.5 de 36,9 % à 63,2 % sur des tâches de manipulation du monde réel difficiles. Ces résultats montrent que les modèles de monde fondateurs peuvent servir à la fois de modèles de monde incarnés et de moteurs de données évolutifs pour l'intelligence incarnée. Le code et les points de contrôle sont disponibles à l'adresse https://robotics.xiaomi.com/xiaomi-robotics-u0.html.
English
Recent foundation image and video generation models offer strong generalization and controllability, but their direct application to embodied scenarios is limited by requirements for multi-view consistency, geometric coherence, and robot embodiment constraints. Existing methods typically adapt foundation models with limited robot data, often sacrificing visual knowledge acquired during large-scale pre-training. We present Xiaomi-Robotics-U0, a 38-billion-parameter multimodal autoregressive model for unified embodied synthesis. It treats embodied generation as an extension of foundation image and video generation and jointly optimizes text-to-image generation, image editing, embodied scene generation, embodied transfer, and embodied video generation. This unified framework preserves the generalization of the pre-trained world foundation model while adapting it to embodied settings. Xiaomi-Robotics-U0 is the first model to support high-quality multi-view scene generation across multiple robot embodiments and to introduce structured, controllable embodied transfer for fine-grained editing while preserving multi-view consistency and interaction dynamics. It achieves state-of-the-art results on single-step and sequential generation tasks, outperforming GPT-Image-2.0 in human evaluations of embodied scene generation and transfer, ranking first on World Arena for embodied video generation, and improving the out-of-distribution success rate of pi_0.5 from 36.9% to 63.2% on challenging real-world manipulation tasks. These results show that foundation world models can serve both as embodied world models and scalable data engines for embodied intelligence. Code and checkpoints are available at https://robotics.xiaomi.com/xiaomi-robotics-u0.html.