Van web naar pixels: de integratie van agentisch zoeken in visuele perceptie
From Web to Pixels: Bringing Agentic Search into Visual Perception
May 12, 2026
Auteurs: Bokang Yang, Xinyi Sun, Kaituo Feng, Xingping Dong, Dongming Wu, Xiangyu Yue
cs.AI
Samenvatting
Visuele perceptie verbindt semantisch begrip op hoog niveau met perceptie op pixelniveau, maar de meeste bestaande instellingen gaan ervan uit dat het doorslaggevende bewijs voor het identificeren van een doelwit zich al in de afbeelding of in de bevroren modelkennis bevindt. Wij bestuderen een praktischer maar moeilijker open-wereldgeval waarbij een zichtbaar object eerst moet worden afgeleid uit externe feiten, recente gebeurtenissen, langstaartentiteiten of multi-hoprelaties voordat het kan worden gelokaliseerd. We formaliseren deze uitdaging als Perception Deep Research en introduceren WebEye, een objectverankerde benchmark met verifieerbaar bewijs, kennisintensieve vragen, nauwkeurige box/maskerannotaties en drie taakaanzichten: Zoekgebaseerde Gronding, Zoekgebaseerde Segmentatie en Zoekgebaseerde VQA. WebEye bevat 120 afbeeldingen, 473 geannoteerde objectinstanties, 645 unieke QA-paren en 1.927 taakvoorbeelden. Verder stellen we Pixel-Searcher voor, een agentische zoek-naar-pixel werkstroom die verborgen doelidentiteiten oplost en deze koppelt aan boxen, maskers of gegronde antwoorden. Experimenten tonen aan dat Pixel-Searcher de sterkste open-sourceprestatie behaalt in alle drie de taakaanzichten, terwijl fouten voornamelijk voortkomen uit bewijsvergaring, identiteitsresolutie en visuele instantiekoppeling.
English
Visual perception connects high-level semantic understanding to pixel-level perception, but most existing settings assume that the decisive evidence for identifying a target is already in the image or frozen model knowledge. We study a more practical yet harder open-world case where a visible object must first be resolved from external facts, recent events, long-tail entities, or multi-hop relations before it can be localized. We formalize this challenge as Perception Deep Research and introduce WebEye, an object-anchored benchmark with verifiable evidence, knowledge-intensive queries, precise box/mask annotations, and three task views: Search-based Grounding, Search-based Segmentation, and Search-based VQA. WebEyes contains 120 images, 473 annotated object instances, 645 unique QA pairs, and 1,927 task samples. We further propose Pixel-Searcher, an agentic search-to-pixel workflow that resolves hidden target identities and binds them to boxes, masks, or grounded answers. Experiments show that Pixel-Searcher achieves the strongest open-source performance across all three task views, while failures mainly arise from evidence acquisition, identity resolution, and visual instance binding.