ChatPaper.aiChatPaper

Unindo o Raciocínio Multimodal Intercalado como um Processo de Decisão Unificado

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

July 4, 2026
Autores: Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang
cs.AI

Resumo

Modelos multimodais unificados (MMUs) demonstram capacidade promissora de raciocínio intercalado entre texto e imagem; no entanto, otimizar efetivamente essa geração multiturno por meio de aprendizado por reforço (AR) ainda é um desafio em aberto. Abordagens existentes aplicam AR exclusivamente às etapas textuais, relegando a geração de imagens a substitutos supervisionados, o que impede que os gradientes de política se propaguem por toda a trajetória intercalada entre modalidades heterogêneas. Isso deixa o potencial do AR para MMUs largamente inexplorado. Neste artigo, apresentamos o BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process, ou seja, unificando o raciocínio multimodal intercalado como um processo de decisão unificado), uma estrutura simples que trata o raciocínio texto-imagem-texto multiturno como um processo de decisão de Markov (PDM) unificado, permitindo a otimização conjunta da geração textual e visual por meio de um único objetivo de AR baseado em princípios. O BRAID calcula uma vantagem compartilhada no nível da trajetória e a propaga de forma coerente tanto para os tokens de texto quanto para os caminhos de remoção de ruído da imagem, cada um otimizado por seu mecanismo de gradiente de política nativo da modalidade. Para lidar ainda com a atribuição de crédito de horizonte longo, o BRAID emprega um juiz baseado em modelo de visão-linguagem (MVL) que pontua cada imagem intermediária quanto à sua utilidade para o raciocínio, fornecendo feedback denso em nível de turno para refinar o aprendizado em ramificações visuais críticas. Experimentos em benchmarks de raciocínio espacial e percepção visual mostram que o BRAID supera consistentemente diversas linhas de base, confirmando que uma formulação unificada de PDM com orientação de pensamento visual é essencial para o raciocínio multimodal eficaz.
English
Unified multi-modal models (UMMs) have shown promising interleaved text-image reasoning capabilities, yet effectively optimizing such multi-turn generation via reinforcement learning (RL) remains an open challenge. Existing approaches apply RL exclusively to text steps, relegating image generation to supervised surrogates, preventing policy gradients from propagating through the full interleaved trajectory across heterogeneous modalities. This leaves the potential of RL for UMMs largely untapped. In the paper, we introduce BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process), a simple framework that casts multi-turn text-image-text reasoning as a unified Markov decision process (MDP), enabling joint optimization of textual and visual generation via a single, principled RL objective. BRAID computes a shared trajectory-level advantage and propagates it coherently into both text tokens and image denoising paths, each optimized through its modality-native policy gradient mechanism. To further address long-horizon credit assignment, BRAID employs a vision-language model (VLM) judge that scores each intermediate image on its reasoning utility, supplying dense turn-level feedback to sharpen learning at critical visual branches. Experiments on spatial reasoning and visual perception benchmarks show that BRAID consistently outperforms various baselines, confirming that a unified MDP formulation with vision-thinking guidance is essential for effective multi-modal reasoning.