PixelEyes: Ontkoppeling van perceptie en redenering voor nauwkeurig zoeken naar visueel bewijs
PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking
June 30, 2026
Auteurs: Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang
cs.AI
Samenvatting
Dit artikel onderzoekt meertraps visueel redeneren en constateert dat multimodale grote taalmodellen (MLLMs) herhaaldelijk falen in het lokaliseren van het doelwit, wat leidt tot lange, redundante trajecten. We schrijven dit falen toe aan de verstrengeling van redeneren en perceptie binnen één model: het MLLM redeneert en lokaliseert tegelijkertijd, en onnauwkeurige lokalisatie leidt tot extra redeneerstappen die het traject opblazen. Om dit probleem op te lossen stellen we PixelEyes voor, een meertraps visueel redenerende agent die redeneren expliciet ontkoppelt van perceptie, d.w.z. de redeneerder bepaalt wat er gezocht moet worden, terwijl een gespecialiseerd perceptie-instrument aangeeft waar het is. Specifiek introduceert PixelEyes: 1) Maskergestuurd visueel zoeken. Een verwijzend segmentatiemodel wordt aangeroepen om maskerprecisie-lokalisatie te bieden, waardoor de redeneerder niet langer hoeft te compenseren voor onnauwkeurige gronding. 2) Semantisch-regiogebaseerd breedte-eerst zoeken (BFS). Om redundante lussen te elimineren die ontstaan door herhaaldelijk bijsnijden van incorrecte subregio's, organiseren we verkenning als een breedte-eerst zoektocht over semantische regio's. Om deze capaciteiten te internaliseren, construeren we de PixelEyes-6K-dataset door expert-trajecten uit bestaande gegevens te hersynthetiseren. Dit verankert expliciet onze maskergestuurde zoek- en BFS-logica in het model. We introduceren verder Pinpoint-Bench, een nul-hint visuele zoekbenchmark, d.w.z. er worden geen locatie-aanwijzingen in de vraag gegeven, met instance-level maskers en bounding boxes die lokalisatiefouten scheiden van redeneerfouten, waardoor gedetailleerde analyse van faalwijzen zoals aandachtsblindheid mogelijk wordt. Recente state-of-the-art MLLMs en visueel redenerende agents laten grote ruimte op Pinpoint-Bench, wat de kwaliteit en moeilijkheidsgraad ervan aantoont. Code en modellen zijn open-source beschikbaar.
English
This paper explores multi-turn visual reasoning and observes that MLLMs repeatedly fail to localize the target, leading to long, redundant trajectories. We attribute this failure to the entanglement of reasoning and perception within a single model, the MLLM reasons and localizes simultaneously, and inaccurate localization triggers additional reasoning turns that bloat the trajectory. To solve this problem, we propose PixelEyes, a multi-turn visual reasoning agent that explicitly decouples reasoning from perception, i.e., the reasoner decides what to look for, while a specialized perception tool answers where it is. Specifically, PixelEyes introduces 1) Mask-guided Visual Search. A referring segmentation model is invoked to provide mask-precise localization, freeing the reasoner from the need to compensate for imprecise grounding. 2) Semantic-region Breadth-first Search (BFS). To eliminate redundant loops caused by repeatedly cropping incorrect sub-regions, we organize exploration as a breadth-first search over semantic regions. To internalize these capabilities, we construct the PixelEyes-6K dataset by resynthesizing expert trajectories from existing data. This explicitly embeds our mask-guided search and BFS logic into the model. We further introduce Pinpoint-Bench, a zero-hint visual search benchmark, i.e., no location cues are provided in the question, with instance-level masks and bounding boxes that separate localization failures from reasoning failures, enabling fine-grained analysis of failure modes such as inattentional blindness. Recent state-of-the-art MLLMs and visual reasoning agents leave large headroom on Pinpoint-Bench, demonstrating its quality and difficulty. Code and models are open-sourced.