Olhe Leve, Pense Pesado: O que o Raciocínio Multimodal em Cadeia de Pensamento Pode e Não Pode Fazer
Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
June 21, 2026
Autores: Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao
cs.AI
Resumo
A Cadeia de Pensamento (CoT, do inglês *Chain-of-Thought*) tornou-se um método padrão para melhorar as capacidades de raciocínio em modelos de linguagem de grande escala (LLMs) ao elicitar o pensamento passo a passo, mas sua eficácia em tarefas multimodais ainda não está clara. Neste artigo, objetivamos investigar sistematicamente a questão central: O que o raciocínio multimodal por Cadeia de Pensamento pode fazer, e onde e por que ele falha? Para tanto, avaliamos 12 tarefas multimodais nas categorias de percepção e raciocínio, utilizando 14 modelos sem raciocínio e 8 modelos com raciocínio. Nossa análise revela diversas descobertas importantes: (1) CoT não é uma solução gratuita (*free lunch*) e deve ser usado seletivamente, dependendo dos requisitos específicos de cada tarefa. Para tarefas de percepção, CoT pode levar a efeitos colaterais indesejados, como desempenho reduzido em ancoragem visual (*visual grounding*) e contagem de objetos. Em contraste, mostra-se eficaz em tarefas de raciocínio que envolvem raciocínio matemático, científico e com múltiplas imagens; (2) Comparados aos modelos originais, os modelos existentes de raciocínio multimodal de código aberto frequentemente apresentam apenas melhorias gerais marginais, possivelmente devido a uma ênfase excessiva no raciocínio matemático em detrimento de capacidades mais amplas; (3) O raciocínio visual permanece um gargalo fundamental para o CoT multimodal atual, pois os modelos exibem um padrão de *Olhar Leve, Pensar Pesado* (*Look Light, Think Heavy*), no qual a reflexão verbal cresce e diminui durante o raciocínio, enquanto a reflexão visual diminui consistentemente. Essas descobertas sugerem que, embora o CoT multimodal lide relativamente bem com a reflexão verbal, ele carece da capacidade de manter uma introspecção visual profunda ao longo de todo o processo de raciocínio.
English
Chain-of-Thought (CoT) has become a standard method for improving reasoning capabilities in large language models (LLMs) by eliciting step-by-step thinking, but its effectiveness in multimodal tasks remains unclear. In this paper, we aim to systematically investigate the key question: What can multimodal Chain-of-Thought reasoning do, and where and why does it fall short? To this end, we evaluate 12 multimodal tasks across perception and reasoning categories using both 14 non-reasoning models and 8 reasoning models. Our analysis reveals several important findings: (1) CoT is not a free lunch and should be used selectively depending on the specific requirements of each task. For perception tasks, CoT can lead to undesirable side effects, such as reduced performance in visual grounding and object counting. In contrast, it proves effective for reasoning tasks involving mathematical, scientific, and multi-image reasoning; (2) Compared to original models, existing open-source multimodal reasoning models often yield only marginal overall improvements, possibly due to an overemphasis on mathematical reasoning at the expense of broader capabilities; (3) Visual reasoning remains a key bottleneck for current multimodal CoT, as models exhibit a Look Light, Think Heavy pattern where verbal reflection rises and falls during reasoning, whereas visual reflection consistently diminishes. These findings suggest that while multimodal CoT handles verbal reflection relatively well, it lacks the ability to maintain deep visual introspection throughout the reasoning process.