ChatPaper.aiChatPaper

Rompendo Cascatas de Falhas: Aprendizagem por Reforço Consciente de Etapas para Raciocínio Multimodal Médico

Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning

June 30, 2026
Autores: Junha Jung, Minbyul Jeong, Suhyeon Lim, Sungwook Jung, Jaehoon Yun, Taeyun Roh, Mujeen Sung, Jaewoo Kang
cs.AI

Resumo

Modelos recentes de linguagem de grande escala multimodais têm demonstrado grande promessa no raciocínio de imagens clínicas, mas os pipelines de pós-treinamento existentes permanecem predominantemente centrados no resultado, dependendo da correção da resposta final ou de preferências em nível de sequência. Isso sofre de atribuição esparsa de crédito, dificultando a otimização do processo de raciocínio essencial para aplicações clínicas. Nossa análise revela que erros em cascata provenientes de falhas de raciocínio em estágios iniciais são uma das principais causas de previsões incorretas em benchmarks de resposta a perguntas visuais médicas (VQA). Motivados por isso, propomos a Otimização de Política Sensível ao Raciocínio Médico (MRPO, na sigla em inglês), um algoritmo de RL que incorpora recompensas de processo passo a passo. Quando a resposta final está incorreta, o MRPO atribui penalidades exponencialmente maiores aos tokens em etapas de raciocínio inválidas anteriores, quebrando cascatas de falhas sem comprometer caminhos bem-sucedidos. Em três backbones de LLM multimodais, o MRPO supera consistentemente o GRPO padrão e uma linha de base RL recente, e no Qwen3-VL-8B-Instruct até supera MLLMs médicos substancialmente maiores, como o HuatuoGPT-Vision-34B, por 2,79 pontos. Além disso, o MRPO reduz as falhas de raciocínio em estágios iniciais de 64,0% para 13,0%, mostrando que a mitigação direcionada de falhas em cascata melhora tanto a qualidade do raciocínio quanto a precisão da resposta final. Nosso código está disponível em https://github.com/dmis-lab/MRPO.
English
Recent multimodal large language models have shown great promise in clinical image reasoning, but existing post-training pipelines remain predominantly outcome-centric, relying on final answer correctness or sequence-level preferences. This suffers from sparse credit assignment, making it difficult to optimize the reasoning process essential for clinical applications. Our analysis reveals that cascading errors from early-stage reasoning failures are a leading cause of incorrect predictions in medical visual question answering (VQA) benchmarks. Motivated by this, we propose Medical Reasoning-aware Policy Optimization (MRPO), an RL algorithm that incorporates step-wise process rewards. When the final answer is incorrect, MRPO assigns exponentially larger penalties to tokens in earlier invalid reasoning steps, breaking failure cascades without compromising successful paths. Across three multimodal LLM backbones, MRPO consistently outperforms standard GRPO and a recent RL baseline, and on Qwen3-VL-8B-Instruct even surpasses substantially larger medical MLLMs such as HuatuoGPT-Vision-34B by 2.79 points. Moreover, MRPO reduces early-stage reasoning failures from 64.0% to 13.0%, showing that targeted mitigation of cascading failures improves both reasoning quality and final answer accuracy. Our code is available at https://github.com/dmis-lab/MRPO