ChatPaper.aiChatPaper

Zijn alle visuele tokens even belangrijk? Objectbewijsbehoudende tokensamenvoeging voor visueel-taalkundig terugvinden

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

July 6, 2026
Auteurs: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang
cs.AI

Samenvatting

Multi-vector visie-taal retrieval bewaart fijnmazig visueel bewijs via maximale-gelijkenis late interactie, maar dichte beeldzijde tokens maken opslag en scoring duur. Bestaande tokencompressiemethoden verlagen deze kosten, maar kunnen object- en regio-niveau bewijs verwijderen of samenvouwen dat toekomstige querytokens mogelijk moeten selecteren. Wij stellen SaMer voor, een objectbewust token-samenvoegingsraamwerk dat beeldzijde post-projector tokens comprimeert tot K representatieve centroïden terwijl de oorspronkelijke late-interactie interface behouden blijft. SaMer gebruikt alleen tijdens training objectannotaties als een samenvoegingsprior om cross-instance vermenging te ontmoedigen, vereist geen ground-truth bounding boxes of detectoren bij inferentie, en past alleen de gedeelde projectielaag aan met bevroren visie- en taalbackbones. Met K=64 verwijdert SaMer meer dan 93% van de beeldzijde tokens en vermindert ColPali opslag met 16,09 keer, terwijl het R@1 op Flickr30K en MSCOCO verbetert. Deze winsten komen voort uit het feit dat objectbewust samenvoegen query-selecteerbaar objectbewijs bewaart dat pruning of alleen-feature pooling kan verwijderen of samenvouwen. SaMer presteert ook beter dan compressiebaselines en vertoont sterkere frase-niveau grounding, wat suggereert dat efficiënte multi-vector retrieval niet alleen afhangt van het verminderen van het aantal tokens, maar van het bewaren van het bewijs dat toekomstige querytokens moeten selecteren.
English
Multi-vector vision-language retrieval preserves fine-grained visual evidence through maximum-similarity late interaction, but dense image-side tokens make storage and scoring expensive. Existing token compression methods reduce this cost, yet they can remove or collapse object- and region-level evidence that future query tokens may need to select. We propose SaMer, an object-aware token merging framework that compresses image-side post-projector tokens into K representative centroids while preserving the original late-interaction interface. SaMer uses object annotations only during training as a merge prior to discourage cross-instance mixing, requires no ground-truth bounding boxes or detectors at inference time, and adapts only the shared projection layer with frozen vision and language backbones. With K=64, SaMer removes more than 93% of image-side tokens and reduces ColPali storage by 16.09times, while improving R@1 on Flickr30K and MSCOCO. These gains arise because object-aware merging preserves query-selectable object evidence that pruning or feature-only pooling can remove or collapse. SaMer also outperforms compression baselines and shows stronger phrase-level grounding, suggesting that efficient multi-vector retrieval depends not only on reducing token count, but on preserving the evidence future query tokens need to select.