Recompensa Densa para Raciocínio 3D Multi-View com Mapas Globais e Visões Locais
Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
June 22, 2026
Autores: Jiho Choi, Seonho Lee, Seojeong Park, Hyunjung Shim
cs.AI
Resumo
A Pergunta e Resposta Visual 3D Multivisão (MV3D-VQA) exige a integração de observações parciais em uma representação coerente de cena 3D e a seleção de pontos de vista informativos para raciocínio espacial em múltiplas etapas. No entanto, os LLMs multimodais atuais são tipicamente treinados com supervisão esparsa no nível das respostas, o que frequentemente resulta em raciocínio entre vistas inconsistente e seleção frágil de pontos de vista. Apresentamos o DR-MV3D (Recompensa Densa para MV3D-VQA), um framework de aprendizado baseado em mapas que fornece recompensas densas e verificáveis para supervisionar o processo de raciocínio. Nossa abordagem decompõe o MV3D-VQA em (i) construção de mapa global alocêntrico, (ii) planejamento de trajetória de visão condicionado à pergunta e (iii) ancoragem egocêntrica para predição de resposta. Para tornar as etapas intermediárias aprendíveis sem anotações manuais, introduzimos duas recompensas: uma recompensa de consistência global que alinha o mapa previsto com alvos pseudo consistentes geometricamente, obtidos de modelos fundamentais de visão 3D congelados (por exemplo, VGGT + SAM3), e uma recompensa de trajetória local que supervisiona a seleção ordenada de pontos de vista. Otimizamos todo o pipeline com otimização de política no nível da trajetória (GRPO). Experimentos em MindCube, VSI-Bench e BLINK (MV) mostram que o DR-MV3D melhora consistentemente em relação a fortes baselines multi-imagem, corroborando a eficácia da supervisão densa no nível do processo para raciocínio 3D multivisão.
English
Multi-view 3D Visual Question Answering (MV3D-VQA) requires integrating partial observations into a coherent 3D scene representation and selecting informative viewpoints for multi-step spatial reasoning. However, current multimodal LLMs are typically trained with sparse, answer-level supervision, which often yields inconsistent cross-view reasoning and brittle view selection. We present DR-MV3D (Dense Reward for MV3D-VQA), a map-grounded learning framework that provides dense, verifiable rewards to supervise the reasoning process. Our approach decomposes MV3D-VQA into (i) allocentric global map construction, (ii) question-conditioned view-trajectory planning, and (iii) egocentric grounding for answer prediction. To make intermediate steps learnable without manual annotations, we introduce two rewards: a global consistency reward that aligns the predicted map with geometry-consistent pseudo targets from frozen 3D vision foundation models (e.g., VGGT + SAM3), and a local trajectory reward that supervises ordered viewpoint selection. We optimize the full pipeline with trajectory-level policy optimization (GRPO). Experiments on MindCube, VSI-Bench, and BLINK (MV) show that DR-MV3D consistently improves over strong multi-image baselines, supporting the effectiveness of process-level dense supervision for multi-view 3D reasoning.