Объединение перемежающегося мультимодального рассуждения как единого процесса принятия решений
Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
July 4, 2026
Авторы: Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang
cs.AI
Аннотация
Унифицированные мультимодальные модели (UMM) демонстрируют многообещающие возможности рассуждений с чередованием текста и изображений, однако эффективная оптимизация такой многопоточной генерации с помощью обучения с подкреплением (RL) остается открытой проблемой. Существующие подходы применяют RL исключительно к текстовым шагам, оставляя генерацию изображений на supervised-суррогатах, что препятствует распространению градиентов политики по всей чередующейся траектории через гетерогенные модальности. Это оставляет потенциал RL для UMM в значительной степени неиспользованным. В данной работе мы представляем BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process) — простую структуру, которая рассматривает многопоточное текстово-изобразительное рассуждение как единый марковский процесс принятия решений (MDP), обеспечивая совместную оптимизацию текстовой и визуальной генерации с помощью единой, обоснованной цели RL. BRAID вычисляет совместное преимущество на уровне траектории и согласованно распространяет его как на текстовые токены, так и на пути денойзинга изображений, каждый из которых оптимизируется через свой собственный механизм градиента политики, специфичный для модальности. Для дальнейшего решения проблемы долгосрочного назначения кредитов BRAID использует судью на основе визуально-языковой модели (VLM), который оценивает каждое промежуточное изображение с точки зрения его полезности для рассуждений, обеспечивая плотную обратную связь на уровне шагов для усиления обучения на критических визуальных ветвях. Эксперименты на бенчмарках пространственного рассуждения и визуального восприятия показывают, что BRAID последовательно превосходит различные базовые модели, подтверждая, что единая формулировка MDP с направляющей визуальным мышлением является важной для эффективного мультимодального рассуждения.
English
Unified multi-modal models (UMMs) have shown promising interleaved text-image reasoning capabilities, yet effectively optimizing such multi-turn generation via reinforcement learning (RL) remains an open challenge. Existing approaches apply RL exclusively to text steps, relegating image generation to supervised surrogates, preventing policy gradients from propagating through the full interleaved trajectory across heterogeneous modalities. This leaves the potential of RL for UMMs largely untapped. In the paper, we introduce BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process), a simple framework that casts multi-turn text-image-text reasoning as a unified Markov decision process (MDP), enabling joint optimization of textual and visual generation via a single, principled RL objective. BRAID computes a shared trajectory-level advantage and propagates it coherently into both text tokens and image denoising paths, each optimized through its modality-native policy gradient mechanism. To further address long-horizon credit assignment, BRAID employs a vision-language model (VLM) judge that scores each intermediate image on its reasoning utility, supplying dense turn-level feedback to sharpen learning at critical visual branches. Experiments on spatial reasoning and visual perception benchmarks show that BRAID consistently outperforms various baselines, confirming that a unified MDP formulation with vision-thinking guidance is essential for effective multi-modal reasoning.