ChatPaper.aiChatPaper

RxBrain: Belichaamd Cognitie Fundamentmodel met Geïntegreerde Taal-Visuele Redenering en Verbeelding

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

July 15, 2026
Auteurs: Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang
cs.AI

Samenvatting

Belichaamde cognitie vereist dat agenten hoogwaardige taakredenering koppelen aan de fysieke toestanden die bereikt moeten worden. Wij introduceren Hy-Embodied-RxBrain, een fundamentmodel voor belichaamde cognitie met geïntegreerde taal-visuele redenering en verbeelding. In tegenstelling tot visie-taalsystemen die zich richten op scènebegrip en tekstuele besluitvorming, of generatieve wereldmodellen die vooral toekomstige visuele toestanden voorspellen, vertegenwoordigt RxBrain belichaamde plannen in een enkele planningsreeks waarin taal en visuele verbeelding complementaire rollen spelen. Taal biedt de abstracte structuur van een plan, inclusief taakdecompositie, planningsprimitieven, beperkingen, temporele volgorde en beslissingslogica, terwijl visuele verbeelding deze structuur verankert door wereldtoestandvoorspelling en gezamenlijke subdoelplanning, waarbij elke planningsstap wordt gekoppeld aan tussenliggende en uiteindelijke fysieke toestanden. RxBrain maakt gebruik van een uniforme multimodale Mixture-of-Transformers-architectuur die zowel begrip als generatie van taal, beeld en video binnen één model ondersteunt. Om deze mogelijkheid te trainen, bouwen we een automatische pijplijn die belichaamde video's omzet in gezamenlijke tekst-visuele planningssupervisie door video's op te splitsen in planningsstappen en deze af te stemmen op visuele toestandsovergangen. Verder introduceren we RxBrain-Bench om te evalueren of modellen belichaamde plannen kunnen representeren via gezamenlijke tekstuele en visuele componenten in plaats van afzonderlijk begrip of generatie. Experimenten tonen aan dat RxBrain belichaamde begrips- en generatievermogens behoudt en plannen produceert met gekoppelde tekstuele redenering, wereldtoestandvoorspelling en gezamenlijke subdoelplanning. We breiden RxBrain ook uit naar continue robotactiegeneratie, waar het veelbelovende prestaties op echte robots laat zien zonder grootschalige actie-datavoorbereiding. Deze resultaten vormen een eerste stap in de richting van fundamentmodellen voor belichaamde cognitie.
English
Embodied cognition requires agents to connect high-level task reasoning with the physical states to be achieved. We introduce Hy-Embodied-RxBrain, an embodied cognition foundation model with joint language-visual reasoning and imagination. Unlike vision-language models that emphasize scene understanding and textual decision making, or generative world models that mainly predict future visual states, RxBrain represents embodied plans in a single planning sequence where language and visual imagination play complementary roles. Language provides the abstract structure of a plan, including task decomposition, planning primitives, constraints, temporal order, and decision logic, while visual imagination grounds this structure through world state prediction and joint subgoal planning, associating each planning step with intermediate and final physical states. RxBrain adopts a unified multimodal Mixture-of-Transformers architecture that supports language, image, and video understanding and generation within one model. To train this capability, we build an automatic pipeline that converts embodied videos into joint text-visual planning supervision by decomposing videos into planning steps and aligning them with visual state transitions. We further introduce RxBrain-Bench to evaluate whether models can represent embodied plans through joint textual and visual components rather than separate understanding or generation. Experiments show that RxBrain maintains embodied understanding and generation abilities, and produces plans with coupled textual reasoning, world state prediction, and joint subgoal planning. We also extend RxBrain to continuous robot action generation, where it shows promising real-robot performance without large-scale action-data pretraining. These results provide an initial step toward foundation models for embodied cognition.