ChatPaper.aiChatPaper

Waarnemen om te Redeneren: Het Ontkoppelen van Waarneming en Redenering voor Fijnmazig Visueel Redeneren

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

July 1, 2026
Auteurs: Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei Xu, Hanrong Zhang, Haiwen Hong, Longtao Huang, Hui Xue, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen
cs.AI

Samenvatting

Fijnmazig visueel redeneren blijft een uitdaging voor visie-taalsystemen, met name wanneer kleine maar kritische visuele aanwijzingen verborgen zijn in afbeeldingen met hoge resolutie. Bestaande benaderingen zijn afhankelijk van herhaald bijsnijden of visueel zoeken tijdens testtijd om lokale bewijsvoering te introduceren, maar maken doorgaans geen expliciet onderscheid tussen perceptie en redeneren. In dit artikel stellen we Perceive-to-Reason (P2R) voor, een uniform raamwerk dat fijnmazig visueel redeneren formuleert als een tweefasenproces: het model lokaliseert eerst vraagrelevante bewijsvoering als een Waarnemer en beantwoordt vervolgens de vraag als een Redeneerder op basis van de geannoteerde afbeelding en bijgesneden gebieden. Om de training beter af te stemmen op deze ontkoppelde formulering introduceren we verder Perception-Reasoning Alternating GRPO (PRA-GRPO), een rolbewuste versterkingsleerstrategie die afwisselt tussen perceptiegerichte en redeneergerichte updates, waarbij alleen supervisie op basis van het uiteindelijke antwoord wordt gebruikt. Gebouwd bovenop Qwen3-VL-Instruct-2B/4B/8B verbetert P2R consistent de prestaties over verschillende modelschalen. In het bijzonder behaalt P2R-4B 93,2% op V-Star, 81,9% op HR-Bench-4K en 80,5% op HR-Bench-8K, waarmee het de bijbehorende backbone aanzienlijk overtreft. Verdere experimenten tonen aan dat de voordelen van P2R verder reiken dan hoogresolutiebenchmarks naar bredere multimodale redeneertaken. Deze resultaten suggereren dat het expliciet ontkoppelen van perceptie en redeneren een effectief raamwerk biedt voor fijnmazig visueel redeneren.
English
Fine-grained visual reasoning remains challenging for vision-language models, especially when small but critical visual cues are buried in high-resolution images. Existing approaches rely on repeated cropping or test-time visual search to introduce local evidence, but they typically do not explicitly distinguish perception from reasoning. In this paper, we propose Perceive-to-Reason (P2R), a unified framework that formulates fine-grained visual reasoning as a two-stage process: the model first localizes question-relevant evidence as a Perceiver, and then answers the question as a Reasoner based on the annotated image and cropped regions. To better align training with this decoupled formulation, we further introduce Perception-Reasoning Alternating GRPO (PRA-GRPO), a role-aware reinforcement learning strategy that alternates between perception-focused and reasoning-focused updates using only final-answer supervision. Built on top of Qwen3-VL-Instruct-2B/4B/8B, P2R consistently improves performance across model scales. In particular, P2R-4B achieves 93.2% on V-Star, 81.9% on HR-Bench-4K, and 80.5% on HR-Bench-8K, substantially outperforming its corresponding backbone. Further experiments show that the benefits of P2R extend beyond high-resolution benchmarks to broader multimodal reasoning tasks. These results suggest that explicitly decoupling perception from reasoning provides an effective framework for fine-grained visual reasoning.