RxBrain: Modelo Fundacional de Cognición Corporeizada con Razonamiento Conjunto Lenguaje-Visión e Imaginación
RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
July 15, 2026
Autores: Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang
cs.AI
Resumen
La cognición corporeizada requiere que los agentes conecten el razonamiento de alto nivel sobre tareas con los estados físicos a alcanzar. Presentamos Hy-Embodied-RxBrain, un modelo fundacional de cognición corporeizada con razonamiento e imaginación conjuntos de lenguaje y visión. A diferencia de los modelos de lenguaje-visión que enfatizan la comprensión de escenas y la toma de decisiones textuales, o los modelos generativos de mundo que principalmente predicen estados visuales futuros, RxBrain representa planes corporeizados en una única secuencia de planificación donde el lenguaje y la imaginación visual desempeñan roles complementarios. El lenguaje proporciona la estructura abstracta de un plan, incluyendo descomposición de tareas, primitivas de planificación, restricciones, orden temporal y lógica de decisión, mientras que la imaginación visual fundamenta esta estructura mediante la predicción del estado del mundo y la planificación conjunta de subobjetivos, asociando cada paso de planificación con estados físicos intermedios y finales. RxBrain adopta una arquitectura unificada multimodal de Mezcla de Transformadores que permite la comprensión y generación de lenguaje, imágenes y video dentro de un mismo modelo. Para entrenar esta capacidad, construimos un canal automático que convierte videos corporeizados en supervisión conjunta de planificación texto-visual, descomponiendo los videos en pasos de planificación y alineándolos con transiciones de estado visual. Además, introducimos RxBrain-Bench para evaluar si los modelos pueden representar planes corporeizados mediante componentes textuales y visuales conjuntos, en lugar de comprensión o generación por separado. Los experimentos muestran que RxBrain mantiene habilidades de comprensión y generación corporeizadas, y produce planes con razonamiento textual acoplado, predicción del estado del mundo y planificación conjunta de subobjetivos. También extendemos RxBrain a la generación de acciones continuas para robots, donde muestra un rendimiento prometedor en robots reales sin preentrenamiento a gran escala con datos de acciones. Estos resultados representan un paso inicial hacia modelos fundacionales para la cognición corporeizada.
English
Embodied cognition requires agents to connect high-level task reasoning with the physical states to be achieved. We introduce Hy-Embodied-RxBrain, an embodied cognition foundation model with joint language-visual reasoning and imagination. Unlike vision-language models that emphasize scene understanding and textual decision making, or generative world models that mainly predict future visual states, RxBrain represents embodied plans in a single planning sequence where language and visual imagination play complementary roles. Language provides the abstract structure of a plan, including task decomposition, planning primitives, constraints, temporal order, and decision logic, while visual imagination grounds this structure through world state prediction and joint subgoal planning, associating each planning step with intermediate and final physical states. RxBrain adopts a unified multimodal Mixture-of-Transformers architecture that supports language, image, and video understanding and generation within one model. To train this capability, we build an automatic pipeline that converts embodied videos into joint text-visual planning supervision by decomposing videos into planning steps and aligning them with visual state transitions. We further introduce RxBrain-Bench to evaluate whether models can represent embodied plans through joint textual and visual components rather than separate understanding or generation. Experiments show that RxBrain maintains embodied understanding and generation abilities, and produces plans with coupled textual reasoning, world state prediction, and joint subgoal planning. We also extend RxBrain to continuous robot action generation, where it shows promising real-robot performance without large-scale action-data pretraining. These results provide an initial step toward foundation models for embodied cognition.