ChatPaper.aiChatPaper

Integrando el razonamiento multimodal entrelazado como un proceso de decisión unificado

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

July 4, 2026
Autores: Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang
cs.AI

Resumen

Los modelos multimodales unificados (UMM) han demostrado capacidades prometedoras de razonamiento intercalado entre texto e imagen, pero optimizar eficazmente dicha generación multi-turno mediante aprendizaje por refuerzo (RL) sigue siendo un desafío abierto. Los enfoques existentes aplican RL exclusivamente a pasos de texto, relegando la generación de imágenes a sustitutos supervisados, lo que impide que los gradientes de política se propaguen a través de la trayectoria intercalada completa entre modalidades heterogéneas. Esto deja sin explotar gran parte del potencial de RL para los UMM. En este artículo, presentamos BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process), un marco simple que formula el razonamiento multi-turno texto-imagen-texto como un proceso de decisión de Markov (MDP) unificado, permitiendo la optimización conjunta de la generación textual y visual mediante un único objetivo de RL basado en principios. BRAID calcula una ventaja compartida a nivel de trayectoria y la propaga de manera coherente tanto a los tokens de texto como a las rutas de eliminación de ruido de imágenes, cada uno optimizado a través de su mecanismo de gradiente de política nativo de la modalidad. Para abordar además la asignación de crédito a largo plazo, BRAID emplea un juez basado en un modelo de visión y lenguaje (VLM) que puntúa cada imagen intermedia según su utilidad para el razonamiento, proporcionando retroalimentación densa a nivel de turno para afinar el aprendizaje en ramas visuales críticas. Los experimentos en benchmarks de razonamiento espacial y percepción visual muestran que BRAID supera consistentemente a diversas líneas base, confirmando que una formulación unificada de MDP con guía de pensamiento visual es esencial para un razonamiento multimodal eficaz.
English
Unified multi-modal models (UMMs) have shown promising interleaved text-image reasoning capabilities, yet effectively optimizing such multi-turn generation via reinforcement learning (RL) remains an open challenge. Existing approaches apply RL exclusively to text steps, relegating image generation to supervised surrogates, preventing policy gradients from propagating through the full interleaved trajectory across heterogeneous modalities. This leaves the potential of RL for UMMs largely untapped. In the paper, we introduce BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process), a simple framework that casts multi-turn text-image-text reasoning as a unified Markov decision process (MDP), enabling joint optimization of textual and visual generation via a single, principled RL objective. BRAID computes a shared trajectory-level advantage and propagates it coherently into both text tokens and image denoising paths, each optimized through its modality-native policy gradient mechanism. To further address long-horizon credit assignment, BRAID employs a vision-language model (VLM) judge that scores each intermediate image on its reasoning utility, supplying dense turn-level feedback to sharpen learning at critical visual branches. Experiments on spatial reasoning and visual perception benchmarks show that BRAID consistently outperforms various baselines, confirming that a unified MDP formulation with vision-thinking guidance is essential for effective multi-modal reasoning.