ChatPaper.aiChatPaper

Da Web aos Pixels: Integrando a Busca Agentiva na Percepção Visual

From Web to Pixels: Bringing Agentic Search into Visual Perception

May 12, 2026
Autores: Bokang Yang, Xinyi Sun, Kaituo Feng, Xingping Dong, Dongming Wu, Xiangyu Yue
cs.AI

Resumo

A percepção visual conecta a compreensão semântica de alto nível à percepção em nível de pixel, mas a maioria das configurações existentes assume que a evidência decisiva para identificar um alvo já está na imagem ou no conhecimento congelado do modelo. Estudamos um caso de mundo aberto mais prático, porém mais difícil, onde um objeto visível deve primeiro ser resolvido a partir de fatos externos, eventos recentes, entidades de cauda longa ou relações de múltiplos saltos antes que possa ser localizado. Formalizamos esse desafio como Pesquisa Profunda de Percepção e apresentamos o WebEye, um benchmark ancorado em objetos com evidências verificáveis, consultas intensivas em conhecimento, anotações precisas de caixas/máscaras e três visões de tarefa: Fundamentação Baseada em Busca, Segmentação Baseada em Busca e VQA Baseado em Busca. O WebEye contém 120 imagens, 473 instâncias de objetos anotados, 645 pares de QA únicos e 1.927 amostras de tarefas. Propomos ainda o Pixel-Searcher, um fluxo de trabalho agêntico de busca até o pixel que resolve identidades ocultas de alvos e as vincula a caixas, máscaras ou respostas fundamentadas. Experimentos mostram que o Pixel-Searcher atinge o melhor desempenho de código aberto em todas as três visões de tarefa, enquanto as falhas surgem principalmente da aquisição de evidências, resolução de identidade e vinculação de instâncias visuais.
English
Visual perception connects high-level semantic understanding to pixel-level perception, but most existing settings assume that the decisive evidence for identifying a target is already in the image or frozen model knowledge. We study a more practical yet harder open-world case where a visible object must first be resolved from external facts, recent events, long-tail entities, or multi-hop relations before it can be localized. We formalize this challenge as Perception Deep Research and introduce WebEye, an object-anchored benchmark with verifiable evidence, knowledge-intensive queries, precise box/mask annotations, and three task views: Search-based Grounding, Search-based Segmentation, and Search-based VQA. WebEyes contains 120 images, 473 annotated object instances, 645 unique QA pairs, and 1,927 task samples. We further propose Pixel-Searcher, an agentic search-to-pixel workflow that resolves hidden target identities and binds them to boxes, masks, or grounded answers. Experiments show that Pixel-Searcher achieves the strongest open-source performance across all three task views, while failures mainly arise from evidence acquisition, identity resolution, and visual instance binding.