RxBrain: Ein Grundlagenmodell der verkörperten Kognition mit gemeinsamer sprach-visueller Schlussfolgerung und Vorstellungskraft
RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
July 15, 2026
Autoren: Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang
cs.AI
Zusammenfassung
Verkörperte Kognition erfordert, dass Agenten abstrakte Planungsüberlegungen auf hoher Ebene mit den zu erreichenden physikalischen Zuständen verknüpfen. Wir stellen Hy-Embodied-RxBrain vor, ein Grundlagenmodell für verkörperte Kognition mit gemeinsamer Sprach-Bild-Argumentation und Imagination. Im Gegensatz zu Bild-Sprach-Modellen, die das Szenenverständnis und die textbasierte Entscheidungsfindung betonen, oder generativen Weltmodellen, die hauptsächlich zukünftige visuelle Zustände vorhersagen, repräsentiert RxBrain verkörperte Pläne in einer einzigen Planungssequenz, in der Sprache und visuelle Imagination komplementäre Rollen spielen. Sprache liefert die abstrakte Struktur eines Plans, einschließlich Aufgabenzerlegung, Planungsprimitive, Randbedingungen, zeitlicher Abfolge und Entscheidungslogik, während visuelle Imagination diese Struktur durch Weltzustandsvorhersage und gemeinsame Teilzielplanung verankert und jeden Planungsschritt mit Zwischen- und Endzuständen der physischen Welt assoziiert. RxBrain verwendet eine einheitliche multimodale Mixture-of-Transformers-Architektur, die Sprach-, Bild- und Videoverständnis sowie -generierung in einem einzigen Modell unterstützt. Um diese Fähigkeit zu trainieren, bauen wir eine automatisierte Pipeline auf, die verkörperte Videos in eine gemeinsame textuell-visuelle Planungsüberwachung umwandelt, indem sie Videos in Planungsschritte zerlegt und diese mit visuellen Zustandsübergängen abgleicht. Wir führen außerdem RxBrain-Bench ein, um zu bewerten, ob Modelle verkörperte Pläne durch gemeinsame textuelle und visuelle Komponenten repräsentieren können, anstatt durch getrenntes Verstehen oder Generieren. Experimente zeigen, dass RxBrain seine verkörperten Verstehens- und Generierungsfähigkeiten bewahrt und Pläne mit gekoppelter textueller Argumentation, Weltzustandsvorhersage und gemeinsamer Teilzielplanung erstellt. Wir erweitern RxBrain zudem auf die kontinuierliche Generierung von Roboteraktionen, wo es vielversprechende Leistungen auf echten Robotern zeigt, ohne auf groß angelegtes Aktionsdaten-Pretraining angewiesen zu sein. Diese Ergebnisse bilden einen ersten Schritt hin zu Grundlagenmodellen für verkörperte Kognition.
English
Embodied cognition requires agents to connect high-level task reasoning with the physical states to be achieved. We introduce Hy-Embodied-RxBrain, an embodied cognition foundation model with joint language-visual reasoning and imagination. Unlike vision-language models that emphasize scene understanding and textual decision making, or generative world models that mainly predict future visual states, RxBrain represents embodied plans in a single planning sequence where language and visual imagination play complementary roles. Language provides the abstract structure of a plan, including task decomposition, planning primitives, constraints, temporal order, and decision logic, while visual imagination grounds this structure through world state prediction and joint subgoal planning, associating each planning step with intermediate and final physical states. RxBrain adopts a unified multimodal Mixture-of-Transformers architecture that supports language, image, and video understanding and generation within one model. To train this capability, we build an automatic pipeline that converts embodied videos into joint text-visual planning supervision by decomposing videos into planning steps and aligning them with visual state transitions. We further introduce RxBrain-Bench to evaluate whether models can represent embodied plans through joint textual and visual components rather than separate understanding or generation. Experiments show that RxBrain maintains embodied understanding and generation abilities, and produces plans with coupled textual reasoning, world state prediction, and joint subgoal planning. We also extend RxBrain to continuous robot action generation, where it shows promising real-robot performance without large-scale action-data pretraining. These results provide an initial step toward foundation models for embodied cognition.