ChatPaper.aiChatPaper

Xiaomi-Robotics-U0: Geïntegreerde Belichaamde Synthese met het Wereld Fundament Model

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

July 13, 2026
Auteurs: Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li
cs.AI

Samenvatting

Recente funderingsmodellen voor beeld- en videogeneratie bieden sterke generalisatie en controleerbaarheid, maar hun directe toepassing in belichaamde scenario's wordt beperkt door vereisten voor multi-view consistentie, geometrische coherentie en beperkingen van robotbelichaming. Bestaande methoden passen funderingsmodellen doorgaans aan met beperkte robotdata, waarbij vaak visuele kennis verloren gaat die is verworven tijdens grootschalige pre-training. Wij presenteren Xiaomi-Robotics-U0, een multimodaal autoregressief model met 38 miljard parameters voor uniforme belichaamde synthese. Het behandelt belichaamde generatie als een uitbreiding van funderingsmodellen voor beeld- en videogeneratie en optimaliseert gezamenlijk tekst-naar-beeld generatie, beeldbewerking, generatie van belichaamde scènes, belichaamde overdracht en generatie van belichaamde video's. Dit uniforme raamwerk behoudt de generalisatie van het vooraf getrainde wereld funderingsmodel terwijl het wordt aangepast aan belichaamde omgevingen. Xiaomi-Robotics-U0 is het eerste model dat hoogwaardige multi-view scènegeneratie ondersteunt voor meerdere robotbelichamingen en gestructureerde, controleerbare belichaamde overdracht introduceert voor fijnmazige bewerking, met behoud van multi-view consistentie en interactiedynamiek. Het behaalt state-of-the-art resultaten op taken voor enkelstaps- en sequentiële generatie, overtreft GPT-Image-2.0 in menselijke evaluaties van belichaamde scènegeneratie en -overdracht, staat op de eerste plaats op World Arena voor generatie van belichaamde video's en verbetert het out-of-distribution succespercentage van pi_0.5 van 36,9% naar 63,2% bij uitdagende manipulaties in de echte wereld. Deze resultaten tonen aan dat funderingsmodellen voor de wereld kunnen dienen als zowel belichaamde wereldmodellen als schaalbare data-engines voor belichaamde intelligentie. Code en controlepuntbestanden zijn beschikbaar op https://robotics.xiaomi.com/xiaomi-robotics-u0.html.
English
Recent foundation image and video generation models offer strong generalization and controllability, but their direct application to embodied scenarios is limited by requirements for multi-view consistency, geometric coherence, and robot embodiment constraints. Existing methods typically adapt foundation models with limited robot data, often sacrificing visual knowledge acquired during large-scale pre-training. We present Xiaomi-Robotics-U0, a 38-billion-parameter multimodal autoregressive model for unified embodied synthesis. It treats embodied generation as an extension of foundation image and video generation and jointly optimizes text-to-image generation, image editing, embodied scene generation, embodied transfer, and embodied video generation. This unified framework preserves the generalization of the pre-trained world foundation model while adapting it to embodied settings. Xiaomi-Robotics-U0 is the first model to support high-quality multi-view scene generation across multiple robot embodiments and to introduce structured, controllable embodied transfer for fine-grained editing while preserving multi-view consistency and interaction dynamics. It achieves state-of-the-art results on single-step and sequential generation tasks, outperforming GPT-Image-2.0 in human evaluations of embodied scene generation and transfer, ranking first on World Arena for embodied video generation, and improving the out-of-distribution success rate of pi_0.5 from 36.9% to 63.2% on challenging real-world manipulation tasks. These results show that foundation world models can serve both as embodied world models and scalable data engines for embodied intelligence. Code and checkpoints are available at https://robotics.xiaomi.com/xiaomi-robotics-u0.html.