ChatPaper.aiChatPaper

PixelEyes: Desacoplando Percepção e Raciocínio para Busca Precisa de Evidências Visuais

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

June 30, 2026
Autores: Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang
cs.AI

Resumo

Este artigo explora o raciocínio visual multi-turno e observa que os MLLMs falham repetidamente em localizar o alvo, levando a trajetórias longas e redundantes. Atribuímos essa falha ao entrelaçamento entre raciocínio e percepção em um único modelo: o MLLM raciocina e localiza simultaneamente, e a localização imprecisa desencadeia turnos adicionais de raciocínio que incham a trajetória. Para solucionar esse problema, propomos o PixelEyes, um agente de raciocínio visual multi-turno que desacopla explicitamente raciocínio de percepção, ou seja, o raciocinador decide o que procurar, enquanto uma ferramenta de percepção especializada responde onde está. Especificamente, o PixelEyes introduz: 1) Busca Visual Guiada por Máscara. Um modelo de segmentação por referência é acionado para fornecer localização precisa por máscara, liberando o raciocinador da necessidade de compensar a fundamentação imprecisa. 2) Busca em Largura sobre Regiões Semânticas. Para eliminar loops redundantes causados pelo recorte repetido de sub-regiões incorretas, organizamos a exploração como uma busca em largura sobre regiões semânticas. Para internalizar essas capacidades, construímos o conjunto de dados PixelEyes-6K, ressintetizando trajetórias de especialistas a partir de dados existentes. Isso incorpora explicitamente nossa lógica de busca guiada por máscara e busca em largura no modelo. Introduzimos ainda o Pinpoint-Bench, um benchmark de busca visual sem pistas, ou seja, nenhuma indicação de localização é fornecida na pergunta, com máscaras e caixas delimitadoras em nível de instância que separam falhas de localização de falhas de raciocínio, permitindo uma análise granular de modos de falha, como a cegueira por desatenção. Os modelos de ponta recentes de MLLMs e agentes de raciocínio visual deixam ampla margem para melhoria no Pinpoint-Bench, demonstrando sua qualidade e dificuldade. O código e os modelos são disponibilizados como código aberto.
English
This paper explores multi-turn visual reasoning and observes that MLLMs repeatedly fail to localize the target, leading to long, redundant trajectories. We attribute this failure to the entanglement of reasoning and perception within a single model, the MLLM reasons and localizes simultaneously, and inaccurate localization triggers additional reasoning turns that bloat the trajectory. To solve this problem, we propose PixelEyes, a multi-turn visual reasoning agent that explicitly decouples reasoning from perception, i.e., the reasoner decides what to look for, while a specialized perception tool answers where it is. Specifically, PixelEyes introduces 1) Mask-guided Visual Search. A referring segmentation model is invoked to provide mask-precise localization, freeing the reasoner from the need to compensate for imprecise grounding. 2) Semantic-region Breadth-first Search (BFS). To eliminate redundant loops caused by repeatedly cropping incorrect sub-regions, we organize exploration as a breadth-first search over semantic regions. To internalize these capabilities, we construct the PixelEyes-6K dataset by resynthesizing expert trajectories from existing data. This explicitly embeds our mask-guided search and BFS logic into the model. We further introduce Pinpoint-Bench, a zero-hint visual search benchmark, i.e., no location cues are provided in the question, with instance-level masks and bounding boxes that separate localization failures from reasoning failures, enabling fine-grained analysis of failure modes such as inattentional blindness. Recent state-of-the-art MLLMs and visual reasoning agents leave large headroom on Pinpoint-Bench, demonstrating its quality and difficulty. Code and models are open-sourced.