ChatPaper.aiChatPaper

Établir un pont entre le raisonnement multimodal entrelacé et un processus de décision unifié

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

July 4, 2026
Auteurs: Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang
cs.AI

Résumé

Les modèles multi-modaux unifiés (UMMs) ont montré des capacités prometteuses de raisonnement entrelacé texte-image, mais optimiser efficacement une telle génération multi-tours via l'apprentissage par renforcement (RL) reste un défi ouvert. Les approches existantes appliquent le RL exclusivement aux étapes textuelles, reléguant la génération d'images à des substituts supervisés, empêchant les gradients de politique de se propager à travers la trajectoire entrelacée complète sur des modalités hétérogènes. Cela laisse le potentiel du RL pour les UMMs largement inexploité. Dans cet article, nous présentons BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process), un cadre simple qui considère le raisonnement multi-tours texte-image-texte comme un processus de décision markovien (MDP) unifié, permettant l'optimisation conjointe de la génération textuelle et visuelle via un unique objectif RL fondé. BRAID calcule un avantage partagé au niveau de la trajectoire et le propage de manière cohérente à la fois dans les jetons textuels et les chemins de débruitage d'images, chacun étant optimisé via son mécanisme de gradient de politique natif de la modalité. Pour mieux traiter l'assignation de crédit à long horizon, BRAID utilise un juge modèle vision-langage (VLM) qui évalue chaque image intermédiaire sur son utilité pour le raisonnement, fournissant un retour dense au niveau des tours pour affiner l'apprentissage aux branches visuelles critiques. Des expériences sur des benchmarks de raisonnement spatial et de perception visuelle montrent que BRAID surpasse constamment diverses lignes de base, confirmant qu'une formulation MDP unifiée avec un guidage de la pensée visuelle est essentielle pour un raisonnement multi-modal efficace.
English
Unified multi-modal models (UMMs) have shown promising interleaved text-image reasoning capabilities, yet effectively optimizing such multi-turn generation via reinforcement learning (RL) remains an open challenge. Existing approaches apply RL exclusively to text steps, relegating image generation to supervised surrogates, preventing policy gradients from propagating through the full interleaved trajectory across heterogeneous modalities. This leaves the potential of RL for UMMs largely untapped. In the paper, we introduce BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process), a simple framework that casts multi-turn text-image-text reasoning as a unified Markov decision process (MDP), enabling joint optimization of textual and visual generation via a single, principled RL objective. BRAID computes a shared trajectory-level advantage and propagates it coherently into both text tokens and image denoising paths, each optimized through its modality-native policy gradient mechanism. To further address long-horizon credit assignment, BRAID employs a vision-language model (VLM) judge that scores each intermediate image on its reasoning utility, supplying dense turn-level feedback to sharpen learning at critical visual branches. Experiments on spatial reasoning and visual perception benchmarks show that BRAID consistently outperforms various baselines, confirming that a unified MDP formulation with vision-thinking guidance is essential for effective multi-modal reasoning.