RxBrain : Modèle de base de cognition incarnée avec raisonnement et imagination conjoints en langage et vision
RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
July 15, 2026
Auteurs: Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang
cs.AI
Résumé
La cognition incarnée exige que les agents connectent le raisonnement de haut niveau sur les tâches avec les états physiques à atteindre. Nous présentons Hy-Embodied-RxBrain, un modèle de fondation de cognition incarnée avec raisonnement et imagination conjoints langage-visuel. Contrairement aux modèles vision-langage qui mettent l'accent sur la compréhension de la scène et la prise de décision textuelle, ou aux modèles génératifs du monde qui prédisent principalement les états visuels futurs, RxBrain représente les plans incarnés dans une séquence de planification unique où le langage et l'imagination visuelle jouent des rôles complémentaires. Le langage fournit la structure abstraite d'un plan, incluant la décomposition des tâches, les primitives de planification, les contraintes, l'ordre temporel et la logique décisionnelle, tandis que l'imagination visuelle ancre cette structure via la prédiction d'état du monde et la planification conjointe de sous-objectifs, associant chaque étape de planification à des états physiques intermédiaires et finaux. RxBrain adopte une architecture multimodale unifiée de type Mixture-of-Transformers qui prend en charge la compréhension et la génération de langage, d'images et de vidéos au sein d'un seul modèle. Pour entraîner cette capacité, nous construisons un pipeline automatique qui convertit les vidéos incarnées en supervision conjointe texte-visuel de planification en décomposant les vidéos en étapes de planification et en les alignant sur les transitions d'état visuel. Nous introduisons également RxBrain-Bench pour évaluer si les modèles peuvent représenter des plans incarnés via des composants textuels et visuels conjoints plutôt qu'une compréhension ou une génération séparée. Les expériences montrent que RxBrain maintient des capacités de compréhension et de génération incarnées, et produit des plans avec un raisonnement textuel couplé, une prédiction d'état du monde et une planification conjointe de sous-objectifs. Nous étendons également RxBrain à la génération d'actions robotiques continues, où il montre des performances prometteuses sur robot réel sans pré-entraînement sur des données d'action à grande échelle. Ces résultats constituent une première étape vers des modèles de fondation pour la cognition incarnée.
English
Embodied cognition requires agents to connect high-level task reasoning with the physical states to be achieved. We introduce Hy-Embodied-RxBrain, an embodied cognition foundation model with joint language-visual reasoning and imagination. Unlike vision-language models that emphasize scene understanding and textual decision making, or generative world models that mainly predict future visual states, RxBrain represents embodied plans in a single planning sequence where language and visual imagination play complementary roles. Language provides the abstract structure of a plan, including task decomposition, planning primitives, constraints, temporal order, and decision logic, while visual imagination grounds this structure through world state prediction and joint subgoal planning, associating each planning step with intermediate and final physical states. RxBrain adopts a unified multimodal Mixture-of-Transformers architecture that supports language, image, and video understanding and generation within one model. To train this capability, we build an automatic pipeline that converts embodied videos into joint text-visual planning supervision by decomposing videos into planning steps and aligning them with visual state transitions. We further introduce RxBrain-Bench to evaluate whether models can represent embodied plans through joint textual and visual components rather than separate understanding or generation. Experiments show that RxBrain maintains embodied understanding and generation abilities, and produces plans with coupled textual reasoning, world state prediction, and joint subgoal planning. We also extend RxBrain to continuous robot action generation, where it shows promising real-robot performance without large-scale action-data pretraining. These results provide an initial step toward foundation models for embodied cognition.