Xiaomi-Robotics-U0: Síntese Incorporada Unificada com Modelo de Fundação do Mundo
Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
July 13, 2026
Autores: Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li
cs.AI
Resumo
Modelos recentes de geração de imagem e vídeo de base oferecem forte generalização e controlabilidade, mas sua aplicação direta em cenários incorporados é limitada por requisitos de consistência multi-visão, coerência geométrica e restrições de incorporação robótica. Métodos existentes tipicamente adaptam modelos de base com dados robóticos limitados, muitas vezes sacrificando o conhecimento visual adquirido durante o pré-treinamento em larga escala. Apresentamos o Xiaomi-Robotics-U0, um modelo autorregressivo multimodal de 38 bilhões de parâmetros para síntese incorporada unificada. Ele trata a geração incorporada como uma extensão da geração de imagem e vídeo de base e otimiza conjuntamente a geração de texto para imagem, edição de imagem, geração de cena incorporada, transferência incorporada e geração de vídeo incorporada. Esta estrutura unificada preserva a generalização do modelo de fundação mundial pré-treinado enquanto o adapta a contextos incorporados. O Xiaomi-Robotics-U0 é o primeiro modelo a suportar geração de cena multi-visão de alta qualidade em múltiplas incorporações robóticas e a introduzir transferência incorporada estruturada e controlável para edição refinada, preservando ao mesmo tempo a consistência multi-visão e a dinâmica de interação. Ele alcança resultados de estado da arte em tarefas de geração de etapa única e sequencial, superando o GPT-Image-2.0 em avaliações humanas de geração e transferência de cena incorporada, classificando-se em primeiro lugar no World Arena para geração de vídeo incorporada e melhorando a taxa de sucesso fora da distribuição do pi_0.5 de 36,9% para 63,2% em tarefas desafiadoras de manipulação no mundo real. Esses resultados mostram que modelos de fundação mundial podem servir tanto como modelos de mundo incorporados quanto como motores de dados escaláveis para inteligência incorporada. O código e os pontos de verificação estão disponíveis em https://robotics.xiaomi.com/xiaomi-robotics-u0.html.
English
Recent foundation image and video generation models offer strong generalization and controllability, but their direct application to embodied scenarios is limited by requirements for multi-view consistency, geometric coherence, and robot embodiment constraints. Existing methods typically adapt foundation models with limited robot data, often sacrificing visual knowledge acquired during large-scale pre-training. We present Xiaomi-Robotics-U0, a 38-billion-parameter multimodal autoregressive model for unified embodied synthesis. It treats embodied generation as an extension of foundation image and video generation and jointly optimizes text-to-image generation, image editing, embodied scene generation, embodied transfer, and embodied video generation. This unified framework preserves the generalization of the pre-trained world foundation model while adapting it to embodied settings. Xiaomi-Robotics-U0 is the first model to support high-quality multi-view scene generation across multiple robot embodiments and to introduce structured, controllable embodied transfer for fine-grained editing while preserving multi-view consistency and interaction dynamics. It achieves state-of-the-art results on single-step and sequential generation tasks, outperforming GPT-Image-2.0 in human evaluations of embodied scene generation and transfer, ranking first on World Arena for embodied video generation, and improving the out-of-distribution success rate of pi_0.5 from 36.9% to 63.2% on challenging real-world manipulation tasks. These results show that foundation world models can serve both as embodied world models and scalable data engines for embodied intelligence. Code and checkpoints are available at https://robotics.xiaomi.com/xiaomi-robotics-u0.html.