ChatPaper.aiChatPaper

Het overbruggen van interleaved multi-modale redenering als een uniform beslissingsproces

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

July 4, 2026
Auteurs: Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang
cs.AI

Samenvatting

Unified multi-modale modellen (UMM's) hebben veelbelovende interleaved tekst-beeld redeneervaardigheden getoond, maar het effectief optimaliseren van dergelijke multi-turn generatie via reinforcement learning (RL) blijft een open uitdaging. Bestaande benaderingen passen RL uitsluitend toe op tekststappen, waarbij beeldgeneratie wordt gedelegeerd aan gesuperviseerde surrogaten, waardoor beleidsgradiënten niet kunnen worden voortgeplant door het volledige interleaved traject over heterogene modaliteiten. Dit laat het potentieel van RL voor UMM's grotendeels onbenut. In dit artikel introduceren we BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process), een eenvoudig raamwerk dat multi-turn tekst-beeld-tekst redeneren beschouwt als een unified Markov-beslissingsproces (MDP), waardoor gezamenlijke optimalisatie van tekstuele en visuele generatie mogelijk wordt via een enkele, principiële RL-doelstelling. BRAID berekent een gedeeld trajectniveau-voordeel en plant dit coherent voort in zowel teksttokens als beeldruisonderdrukkingspaden, elk geoptimaliseerd via zijn modaliteit-eigen beleidsgradiëntmechanisme. Om verdere toewijzing van krediet over lange horizon aan te pakken, gebruikt BRAID een visie-taalmodel (VLM) jurylid dat elke tussentijdse afbeelding beoordeelt op zijn redeneernut, en zo dichte feedback op turn-niveau levert om het leren op kritieke visuele vertakkingen te verscherpen. Experimenten op benchmarks voor ruimtelijk redeneren en visuele perceptie tonen aan dat BRAID consequent beter presteert dan verschillende baselines, wat bevestigt dat een unified MDP-formulering met visie-denkbegeleiding essentieel is voor effectief multimodaal redeneren.
English
Unified multi-modal models (UMMs) have shown promising interleaved text-image reasoning capabilities, yet effectively optimizing such multi-turn generation via reinforcement learning (RL) remains an open challenge. Existing approaches apply RL exclusively to text steps, relegating image generation to supervised surrogates, preventing policy gradients from propagating through the full interleaved trajectory across heterogeneous modalities. This leaves the potential of RL for UMMs largely untapped. In the paper, we introduce BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process), a simple framework that casts multi-turn text-image-text reasoning as a unified Markov decision process (MDP), enabling joint optimization of textual and visual generation via a single, principled RL objective. BRAID computes a shared trajectory-level advantage and propagates it coherently into both text tokens and image denoising paths, each optimized through its modality-native policy gradient mechanism. To further address long-horizon credit assignment, BRAID employs a vision-language model (VLM) judge that scores each intermediate image on its reasoning utility, supplying dense turn-level feedback to sharpen learning at critical visual branches. Experiments on spatial reasoning and visual perception benchmarks show that BRAID consistently outperforms various baselines, confirming that a unified MDP formulation with vision-thinking guidance is essential for effective multi-modal reasoning.