ChatPaper.aiChatPaper

Tous les jetons visuels comptent-ils également ? Fusion de jetons avec préservation des preuves d'objets pour la recherche vision-langage

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

July 6, 2026
Auteurs: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang
cs.AI

Résumé

La recherche multi-vecteurs vision-langage préserve les preuves visuelles fines grâce à une interaction tardive à similarité maximale, mais la densité des tokens côté image rend le stockage et la notation coûteux. Les méthodes existantes de compression de tokens réduisent ce coût, mais peuvent supprimer ou écraser les preuves au niveau des objets et des régions que les futurs tokens de requête pourraient devoir sélectionner. Nous proposons SaMer, un cadre de fusion de tokens consciente des objets qui comprime les tokens côté image après le projecteur en K centroïdes représentatifs tout en préservant l'interface d'interaction tardive originale. SaMer utilise les annotations d'objets uniquement pendant l'entraînement comme un a priori de fusion pour décourager le mélange inter-instances, ne nécessite ni boîtes englobantes de vérité terrain ni détecteurs lors de l'inférence, et n'adapte que la couche de projection partagée avec les backbones vision et langage figés. Avec K=64, SaMer supprime plus de 93% des tokens côté image et réduit le stockage de ColPali de 16,09 fois, tout en améliorant le R@1 sur Flickr30K et MSCOCO. Ces gains proviennent du fait que la fusion consciente des objets préserve les preuves d'objets sélectionnables par la requête que l'élagage ou le regroupement par caractéristiques uniquement peuvent supprimer ou écraser. SaMer surpasse également les références de compression et montre un ancrage plus fort au niveau des phrases, ce qui suggère qu'une recherche multi-vecteurs efficace ne dépend pas seulement de la réduction du nombre de tokens, mais aussi de la préservation des preuves que les futurs tokens de requête devront sélectionner.
English
Multi-vector vision-language retrieval preserves fine-grained visual evidence through maximum-similarity late interaction, but dense image-side tokens make storage and scoring expensive. Existing token compression methods reduce this cost, yet they can remove or collapse object- and region-level evidence that future query tokens may need to select. We propose SaMer, an object-aware token merging framework that compresses image-side post-projector tokens into K representative centroids while preserving the original late-interaction interface. SaMer uses object annotations only during training as a merge prior to discourage cross-instance mixing, requires no ground-truth bounding boxes or detectors at inference time, and adapts only the shared projection layer with frozen vision and language backbones. With K=64, SaMer removes more than 93% of image-side tokens and reduces ColPali storage by 16.09times, while improving R@1 on Flickr30K and MSCOCO. These gains arise because object-aware merging preserves query-selectable object evidence that pruning or feature-only pooling can remove or collapse. SaMer also outperforms compression baselines and shows stronger phrase-level grounding, suggesting that efficient multi-vector retrieval depends not only on reducing token count, but on preserving the evidence future query tokens need to select.