ChatPaper.aiChatPaper

Como e o que imaginar? Pensamento Visual em Modelos Multimodais Unificados para Raciocínio Espacial de Visão Cruzada

How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

May 26, 2026
Autores: Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi, Perouz Taslakian, Aishwarya Agrawal
cs.AI

Resumo

O raciocínio espacial entre vistas continua sendo um ponto fraco para modelos de visão-linguagem (VLMs): eles frequentemente raciocinam em linguagem e perdem a geometria de granular fina necessária para a tarefa. Pensar com imagens visa abordar essa limitação gerando uma imagem de pensamento intermediária, mas trabalhos recentes mostram que os modelos frequentemente ignoram as evidências visuais nesses traços. Portanto, perguntamos como tornar o pensamento visual relevante e que tipo de pensamento visual funciona melhor. Estudamos essas questões em modelos multimodais unificados (UMMs), que suportam nativamente a geração intercalada de imagem e texto. Para a primeira questão, propomos o View Dropout (VDrop), uma intervenção durante o treinamento que oculta partes de uma vista de entrada do segmento de resposta, mantendo-as visíveis para os tokens da imagem de pensamento. Isso incentiva o modelo a usar a imagem de pensamento ao responder, em vez de depender apenas das vistas de entrada. Uma vez que a imagem de pensamento é usada para a predição da resposta, estudamos qual tipo de pensamento visual é mais eficaz. Enquadramos isso como um trade-off entre aprendibilidade e informatividade e comparamos três variantes de imagem de pensamento: renderizações de cima para baixo, panorâmica e de correspondência de pontos. Treinado em cenas sintéticas e avaliado em cinco benchmarks do mundo real fora do domínio, o pensamento visual panorâmico com VDrop é a única configuração que é simultaneamente informativa e aprendível, e alcança a melhor generalização fora do domínio.
English
Cross-view spatial reasoning remains a weak spot for vision-language models (VLMs): they often reason in language and lose the fine-grained geometry needed for the task. Thinking with images aims to address this by generating an intermediate thinking image, but recent work shows that models often ignore the visual evidence in these traces. We therefore ask how to make visual thinking matter, and what kind of visual thinking works best. We study these questions in unified multimodal models (UMMs), which natively support interleaved image-text generation. For the first question, we propose View Dropout (VDrop), a training-time intervention that hides parts of one input view from the answer span while keeping them visible to the thinking-image tokens. This encourages the model to use the thinking image when answering, instead of relying only on the input views. Once the thinking image is used for answer prediction, we study which type of visual thinking is most effective. We frame this as a learnability-informativeness tradeoff and compare three thinking-image variants: top-down, panoramic, and point-matching renderings. Trained on synthetic scenes and evaluated on five real-world out-of-domain benchmarks, panoramic visual thinking with VDrop is the only configuration that is both informative and learnable, and it achieves the best out-of-domain generalization.