V-Zero: Destilação On-Policy Sem Rótulos de Resposta com Portão de Evidência Contrastiva para Raciocínio Visual de Granularidade Fina
V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning
June 24, 2026
Autores: Haoxiang Sun, Zhihang Yi, Langxuan Deng, Yuhao Zhou, Peiqi Jia, Jian Zhao, Li Yuan, Jiancheng Lv, Tao Wang
cs.AI
Resumo
O raciocínio visual de granularidade fina exige que modelos de linguagem grandes multimodais (MLLMs) identifiquem evidências visuais relevantes para a tarefa e fundamentem seu raciocínio em regiões locais da imagem. Métodos agentivos existentes geralmente dependem de aprendizado por reforço com recompensas verificáveis ou de ajuste fino supervisionado em trilhas de raciocínio anotadas em larga escala, o que resulta em exploração custosa, regras de verificação projetadas manualmente ou forte dependência de supervisão textual. Uma forma natural de evitar esses rótulos externos de resposta é aprender a partir de trajetórias amostradas pelo próprio estudante, o que aponta para a Destilação On-Policy (OPD). Para compreender o que a OPD pode e não pode oferecer para o raciocínio visual, revisitamos essa abordagem como um alinhamento de gradiente parado livre de negativos. Essa perspectiva mostra que, embora a OPD forneça correção eficaz no nível de tokens, seu teto é limitado pela ausência de discriminação no nível de trajetórias. Motivados por essas observações, propomos o V-Zero, uma estrutura livre de rótulos de resposta para raciocínio visual com controle de evidências contrastivas. O V-Zero não utiliza rótulos de resposta textual anotados; em vez disso, durante o treinamento, ele combina um recorte regional relevante para a pergunta com uma visão negativa para avaliar as trajetórias amostradas pelo estudante e controlar a destilação densa no nível de tokens. Experimentos em diversos benchmarks de raciocínio visual mostram que o V-Zero melhora consistentemente o raciocínio visual de granularidade fina, preservando forte generalização. Notavelmente, o V-Zero é mais de 5 vezes mais rápido que métodos anteriores de ajuste fino supervisionado e mais de 10 vezes mais rápido que as bases de aprendizado por reforço. O código e o conjunto de dados serão divulgados em https://github.com/eVI-group-SCU/V-Zero.
English
Fine-grained visual reasoning requires multimodal large language models (MLLMs) to identify task-relevant visual evidence and ground their reasoning in local image regions. Existing agentic methods typically rely on reinforcement learning with verifiable rewards or supervised fine-tuning on large-scale annotated reasoning traces, leading to costly exploration, hand-designed verification rules, or heavy dependence on textual supervision. A natural way to avoid such external answer labels is to learn from trajectories sampled by the student itself, which points to On-Policy Distillation (OPD). To understand what OPD can and cannot provide for visual reasoning, we revisit it as negative-free stop-gradient alignment. This perspective shows that, although OPD provides effective token-level correction, its ceiling is constrained by the absence of trajectory-level discrimination. Motivated by these observations, we propose V-Zero, an answer-label-free framework for visual reasoning with contrastive evidence gating. V-Zero uses no annotated textual answer labels; instead, during training it pairs a question-relevant regional crop with a negative visual view to evaluate student-sampled trajectories and gate dense token-level distillation. Experiments on multiple visual reasoning benchmarks show that V-Zero consistently improves fine-grained visual reasoning while preserving strong generalization. Notably, V-Zero is more than 5times faster than previous supervised fine-tuning methods and more than 10times faster than reinforcement learning baselines. Code and dataset will be released at https://github.com/eVI-group-SCU/V-Zero