Xiaomi-Robotics-U0: Síntesis Unificada de Embodied con Modelo Fundacional del Mundo
Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
July 13, 2026
Autores: Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li
cs.AI
Resumen
Los modelos recientes de generación de imágenes y video basados en modelos fundacionales ofrecen una fuerte generalización y controlabilidad, pero su aplicación directa a escenarios encarnados se ve limitada por los requisitos de consistencia multivista, coherencia geométrica y restricciones de la encarnación robótica. Los métodos existentes suelen adaptar modelos fundacionales con datos robóticos limitados, sacrificando a menudo el conocimiento visual adquirido durante el preentrenamiento a gran escala. Presentamos Xiaomi-Robotics-U0, un modelo autorregresivo multimodal de 38 mil millones de parámetros para la síntesis encarnada unificada. Este modelo trata la generación encarnada como una extensión de la generación fundacional de imágenes y video, y optimiza conjuntamente la generación de texto a imagen, la edición de imágenes, la generación de escenas encarnadas, la transferencia encarnada y la generación de video encarnado. Este marco unificado preserva la generalización del modelo fundacional del mundo preentrenado mientras lo adapta a entornos encarnados. Xiaomi-Robotics-U0 es el primer modelo que admite la generación de escenas multivista de alta calidad a través de múltiples encarnaciones robóticas e introduce una transferencia encarnada estructurada y controlable para una edición detallada, preservando al mismo tiempo la consistencia multivista y las dinámicas de interacción. Logra resultados de última generación en tareas de generación de un solo paso y secuenciales, superando a GPT-Image-2.0 en evaluaciones humanas de generación y transferencia de escenas encarnadas, posicionándose primero en World Arena para la generación de video encarnado, y mejorando la tasa de éxito fuera de distribución de pi_0.5 del 36.9% al 63.2% en tareas desafiantes de manipulación en el mundo real. Estos resultados demuestran que los modelos fundacionales del mundo pueden servir tanto como modelos encarnados del mundo como motores de datos escalables para la inteligencia encarnada. El código y los puntos de control están disponibles en https://robotics.xiaomi.com/xiaomi-robotics-u0.html.
English
Recent foundation image and video generation models offer strong generalization and controllability, but their direct application to embodied scenarios is limited by requirements for multi-view consistency, geometric coherence, and robot embodiment constraints. Existing methods typically adapt foundation models with limited robot data, often sacrificing visual knowledge acquired during large-scale pre-training. We present Xiaomi-Robotics-U0, a 38-billion-parameter multimodal autoregressive model for unified embodied synthesis. It treats embodied generation as an extension of foundation image and video generation and jointly optimizes text-to-image generation, image editing, embodied scene generation, embodied transfer, and embodied video generation. This unified framework preserves the generalization of the pre-trained world foundation model while adapting it to embodied settings. Xiaomi-Robotics-U0 is the first model to support high-quality multi-view scene generation across multiple robot embodiments and to introduce structured, controllable embodied transfer for fine-grained editing while preserving multi-view consistency and interaction dynamics. It achieves state-of-the-art results on single-step and sequential generation tasks, outperforming GPT-Image-2.0 in human evaluations of embodied scene generation and transfer, ranking first on World Arena for embodied video generation, and improving the out-of-distribution success rate of pi_0.5 from 36.9% to 63.2% on challenging real-world manipulation tasks. These results show that foundation world models can serve both as embodied world models and scalable data engines for embodied intelligence. Code and checkpoints are available at https://robotics.xiaomi.com/xiaomi-robotics-u0.html.