ChatPaper.aiChatPaper

Raciocínio Contínuo Multimodal via Aprendizado Variacional Mútuo Assimétrico

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

July 1, 2026
Autores: Shijie Li, Yilin Gao, Siyuan Yang, Tieyuan Chen, Chaofan Gan, Zhihao He, Zicheng Zhao, Yuyu Guo, Weiyao Lin, Hang Yu
cs.AI

Resumo

Modelos de Linguagem Grandes Multimodais (MLLMs) são frequentemente limitados por um gargalo no espaço de linguagem, forçando o raciocínio visual complexo a ser representado em tokens discretos, o que pode perder nuances perceptivas. Uma alternativa promissora é o raciocínio latente contínuo, cujo objetivo é descobrir caminhos implícitos de raciocínio que conectam a consulta multimodal à resposta final. No entanto, isso introduz uma grave incompatibilidade treino-inferência: um posterior no momento do treino, condicionado à resposta correta, pode explorar atalhos dependentes da resposta. O treinamento variacional padrão então força a priori no momento da inferência a imitar um posterior que tem acesso a informações indisponíveis no momento do teste, levando a um desempenho ruim. Para lidar com isso, propomos o Aprendizado Variacional Mútuo Assimétrico (AMVL), uma estrutura que resolve essa incompatibilidade por meio de um objetivo de calibração bidirecional. Uma divergência KL direta treina a priori, que é independente do alvo, para corresponder ao posterior, enquanto uma divergência KL reversa inovadora regulariza simultaneamente o posterior, impedindo-o de colapsar em regiões incompatíveis com a inferência e mitigando esse "vazamento de resposta". Fornecemos análise teórica formalizando esse vazamento como contaminação da priori e provamos que nosso objetivo KL duplo o reduz. Instanciamos o AMVL em um MLLM com integração latente e mostramos que ele supera consistentemente fortes linhas de base de raciocínio discreto e latente, melhorando a pontuação média no complexo benchmark BLINK em +10,83 e obtendo ganhos de até +32,00 em tarefas individuais de raciocínio, com análises confirmando a melhoria na estabilidade do espaço latente.
English
Multimodal Large Language Models (MLLMs) are often constrained by a language-space bottleneck, forcing complex visual reasoning into discrete tokens which can lose perceptual nuance. A promising alternative is continuous latent reasoning, where the goal is to discover implicit reasoning pathways that bridge the multimodal query and the final answer. However, this introduces a severe train-inference mismatch: a training-time posterior, conditioned on the ground-truth answer, can exploit answer-dependent shortcuts. Standard variational training then forces the inference-time prior to mimic a posterior that has access to information unavailable at test time, leading to poor performance. To address this, we propose Asymmetric Mutual Variational Learning (AMVL), a framework that resolves this mismatch via a bidirectional calibration objective. A forward KL divergence trains the target-agnostic prior to match the posterior, while a novel reverse KL divergence simultaneously regularizes the posterior, preventing it from collapsing into inference-incompatible regions and mitigating this ``answer leakage''. We provide theoretical analysis formalizing this leakage as prior contamination and prove that our dual-KL objective reduces it. We instantiate AMVL in a latent-integrated MLLM and show that it consistently outperforms strong discrete and latent-reasoning baselines, improving the average score on the complex BLINK benchmark by +10.83 and achieving gains of up to +32.00 on individual reasoning tasks, with analyses confirming improved latent-space stability.