ChatPaper.aiChatPaper

Perceber-para-Raciocinar: Desacoplamento da Percepção e do Raciocínio para Raciocínio Visual de Granulação Fina

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

July 1, 2026
Autores: Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei Xu, Hanrong Zhang, Haiwen Hong, Longtao Huang, Hui Xue, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen
cs.AI

Resumo

O raciocínio visual de granularidade fina continua sendo desafiador para modelos de visão-linguagem, especialmente quando pistas visuais pequenas, porém críticas, estão ocultas em imagens de alta resolução. Abordagens existentes dependem de cortes repetidos ou busca visual em tempo de teste para introduzir evidências locais, mas geralmente não distinguem explicitamente percepção de raciocínio. Neste artigo, propomos Perceive-to-Reason (P2R), uma estrutura unificada que formula o raciocínio visual de granularidade fina como um processo de dois estágios: o modelo primeiro localiza evidências relevantes para a pergunta como um Perceiver (Perceptor) e, em seguida, responde à pergunta como um Reasoner (Raciocinador) com base na imagem anotada e nas regiões recortadas. Para alinhar melhor o treinamento com esta formulação desacoplada, introduzimos ainda a Perception-Reasoning Alternating GRPO (PRA-GRPO), uma estratégia de aprendizado por reforço ciente dos papéis que alterna entre atualizações focadas na percepção e no raciocínio, utilizando apenas supervisão da resposta final. Construído sobre Qwen3-VL-Instruct-2B/4B/8B, o P2R melhora consistentemente o desempenho em todas as escalas de modelo. Em particular, o P2R-4B atinge 93,2% no V-Star, 81,9% no HR-Bench-4K e 80,5% no HR-Bench-8K, superando substancialmente sua arquitetura base correspondente. Experimentos adicionais mostram que os benefícios do P2R se estendem além de benchmarks de alta resolução para tarefas mais amplas de raciocínio multimodal. Esses resultados sugerem que desacoplar explicitamente a percepção do raciocínio fornece uma estrutura eficaz para o raciocínio visual de granularidade fina.
English
Fine-grained visual reasoning remains challenging for vision-language models, especially when small but critical visual cues are buried in high-resolution images. Existing approaches rely on repeated cropping or test-time visual search to introduce local evidence, but they typically do not explicitly distinguish perception from reasoning. In this paper, we propose Perceive-to-Reason (P2R), a unified framework that formulates fine-grained visual reasoning as a two-stage process: the model first localizes question-relevant evidence as a Perceiver, and then answers the question as a Reasoner based on the annotated image and cropped regions. To better align training with this decoupled formulation, we further introduce Perception-Reasoning Alternating GRPO (PRA-GRPO), a role-aware reinforcement learning strategy that alternates between perception-focused and reasoning-focused updates using only final-answer supervision. Built on top of Qwen3-VL-Instruct-2B/4B/8B, P2R consistently improves performance across model scales. In particular, P2R-4B achieves 93.2% on V-Star, 81.9% on HR-Bench-4K, and 80.5% on HR-Bench-8K, substantially outperforming its corresponding backbone. Further experiments show that the benefits of P2R extend beyond high-resolution benchmarks to broader multimodal reasoning tasks. These results suggest that explicitly decoupling perception from reasoning provides an effective framework for fine-grained visual reasoning.