ChatPaper.aiChatPaper

Todos os tokens visuais importam igualmente? Fusão de Tokens Preservando Evidências de Objetos para Recuperação Visão-Linguagem

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

July 6, 2026
Autores: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang
cs.AI

Resumo

A recuperação multivetorial visão-linguagem preserva evidências visuais de granulação fina por meio de interação tardia de máxima similaridade, mas os tokens densos do lado da imagem tornam o armazenamento e a pontuação caros. Os métodos existentes de compressão de tokens reduzem esse custo, mas podem remover ou colapsar evidências em nível de objeto e região que futuros tokens de consulta podem precisar selecionar. Propomos o SaMer, uma estrutura de fusão de tokens consciente de objetos que comprime tokens pós-projetor do lado da imagem em K centroides representativos, preservando a interface original de interação tardia. O SaMer usa anotações de objetos apenas durante o treinamento como um prior de fusão para desencorajar a mistura entre instâncias, não requer caixas delimitadoras ground-truth ou detectores no momento da inferência, e adapta apenas a camada de projeção compartilhada com backbones de visão e linguagem congelados. Com K=64, o SaMer remove mais de 93% dos tokens do lado da imagem e reduz o armazenamento do ColPali em 16,09 vezes, enquanto melhora o R@1 no Flickr30K e no MSCOCO. Esses ganhos surgem porque a fusão consciente de objetos preserva evidências de objetos selecionáveis por consulta que a poda ou o pooling apenas de características podem remover ou colapsar. O SaMer também supera as linhas de base de compressão e mostra um grounding em nível de frase mais forte, sugerindo que a recuperação multivetorial eficiente depende não apenas da redução do número de tokens, mas da preservação das evidências que futuros tokens de consulta precisam selecionar.
English
Multi-vector vision-language retrieval preserves fine-grained visual evidence through maximum-similarity late interaction, but dense image-side tokens make storage and scoring expensive. Existing token compression methods reduce this cost, yet they can remove or collapse object- and region-level evidence that future query tokens may need to select. We propose SaMer, an object-aware token merging framework that compresses image-side post-projector tokens into K representative centroids while preserving the original late-interaction interface. SaMer uses object annotations only during training as a merge prior to discourage cross-instance mixing, requires no ground-truth bounding boxes or detectors at inference time, and adapts only the shared projection layer with frozen vision and language backbones. With K=64, SaMer removes more than 93% of image-side tokens and reduces ColPali storage by 16.09times, while improving R@1 on Flickr30K and MSCOCO. These gains arise because object-aware merging preserves query-selectable object evidence that pruning or feature-only pooling can remove or collapse. SaMer also outperforms compression baselines and shows stronger phrase-level grounding, suggesting that efficient multi-vector retrieval depends not only on reducing token count, but on preserving the evidence future query tokens need to select.