ChatPaper.aiChatPaper

RxBrain: Фундаментальная модель воплощенного познания с совместным языково-визуальным рассуждением и воображением

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

July 15, 2026
Авторы: Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang
cs.AI

Аннотация

Воплощенное познание требует, чтобы агенты связывали высокоуровневое рассуждение о задачах с достижимыми физическими состояниями. Мы представляем Hy-Embodied-RxBrain — фундаментальную модель воплощенного познания, обладающую совместным языково-визуальным рассуждением и воображением. В отличие от моделей зрения-языка, делающих акцент на понимании сцены и текстовом принятии решений, или генеративных моделей мира, которые в основном предсказывают будущие визуальные состояния, RxBrain представляет воплощенные планы в единой последовательности планирования, где язык и визуальное воображение играют взаимодополняющие роли. Язык обеспечивает абстрактную структуру плана, включая декомпозицию задачи, примитивы планирования, ограничения, временной порядок и логику принятия решений, тогда как визуальное воображение обосновывает эту структуру через предсказание состояния мира и совместное планирование подцелей, связывая каждый шаг планирования с промежуточными и конечными физическими состояниями. RxBrain использует унифицированную мультимодальную архитектуру Mixture-of-Transformers, которая поддерживает понимание и генерацию языка, изображений и видео в рамках одной модели. Для обучения этой способности мы создаем автоматический конвейер, который преобразует воплощенные видео в совместное текстово-визуальное обучение планированию, разбивая видео на шаги планирования и выравнивая их с переходами визуальных состояний. Кроме того, мы представляем RxBrain-Bench для оценки того, могут ли модели представлять воплощенные планы через совместные текстовые и визуальные компоненты, а не через раздельное понимание или генерацию. Эксперименты показывают, что RxBrain сохраняет способности к воплощенному пониманию и генерации, а также создает планы с объединенным текстовым рассуждением, предсказанием состояния мира и совместным планированием подцелей. Мы также расширяем RxBrain на генерацию непрерывных действий робота, где он демонстрирует многообещающую производительность на реальном роботе без предварительного обучения на крупномасштабных данных о действиях. Эти результаты представляют собой начальный шаг к созданию фундаментальных моделей для воплощенного познания.
English
Embodied cognition requires agents to connect high-level task reasoning with the physical states to be achieved. We introduce Hy-Embodied-RxBrain, an embodied cognition foundation model with joint language-visual reasoning and imagination. Unlike vision-language models that emphasize scene understanding and textual decision making, or generative world models that mainly predict future visual states, RxBrain represents embodied plans in a single planning sequence where language and visual imagination play complementary roles. Language provides the abstract structure of a plan, including task decomposition, planning primitives, constraints, temporal order, and decision logic, while visual imagination grounds this structure through world state prediction and joint subgoal planning, associating each planning step with intermediate and final physical states. RxBrain adopts a unified multimodal Mixture-of-Transformers architecture that supports language, image, and video understanding and generation within one model. To train this capability, we build an automatic pipeline that converts embodied videos into joint text-visual planning supervision by decomposing videos into planning steps and aligning them with visual state transitions. We further introduce RxBrain-Bench to evaluate whether models can represent embodied plans through joint textual and visual components rather than separate understanding or generation. Experiments show that RxBrain maintains embodied understanding and generation abilities, and produces plans with coupled textual reasoning, world state prediction, and joint subgoal planning. We also extend RxBrain to continuous robot action generation, where it shows promising real-robot performance without large-scale action-data pretraining. These results provide an initial step toward foundation models for embodied cognition.