¿Importan todos los tokens visuales por igual? Fusión de Tokens Preservando Evidencia de Objetos para la Recuperación Visión-Lenguaje
Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
July 6, 2026
Autores: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang
cs.AI
Resumen
La recuperación multi-vector de lenguaje visual preserva evidencia visual de grano fino mediante interacción tardía de máxima similitud, pero los tokens densos del lado de la imagen hacen que el almacenamiento y la puntuación sean costosos. Los métodos existentes de compresión de tokens reducen este costo, pero pueden eliminar o colapsar la evidencia a nivel de objetos y regiones que los tokens de consulta futuros podrían necesitar seleccionar. Proponemos SaMer, un marco de fusión de tokens con conciencia de objetos que comprime los tokens posteriores al proyector del lado de la imagen en K centroides representativos, preservando al mismo tiempo la interfaz original de interacción tardía. SaMer utiliza anotaciones de objetos solo durante el entrenamiento como prioridad de fusión para desalentar la mezcla entre instancias, no requiere cuadros delimitadores reales ni detectores en inferencia, y adapta únicamente la capa de proyección compartida con los backbones de visión y lenguaje congelados. Con K=64, SaMer elimina más del 93% de los tokens del lado de la imagen y reduce el almacenamiento de ColPali en 16,09 veces, mientras mejora R@1 en Flickr30K y MSCOCO. Estas mejoras surgen porque la fusión con conciencia de objetos preserva la evidencia de objetos seleccionable por consultas que la poda o la agrupación solo por características pueden eliminar o colapsar. SaMer también supera las líneas base de compresión y muestra un anclaje a nivel de frases más sólido, lo que sugiere que la recuperación multi-vector eficiente no solo depende de reducir el número de tokens, sino de preservar la evidencia que los tokens de consulta futuros necesitan seleccionar.
English
Multi-vector vision-language retrieval preserves fine-grained visual evidence through maximum-similarity late interaction, but dense image-side tokens make storage and scoring expensive. Existing token compression methods reduce this cost, yet they can remove or collapse object- and region-level evidence that future query tokens may need to select. We propose SaMer, an object-aware token merging framework that compresses image-side post-projector tokens into K representative centroids while preserving the original late-interaction interface. SaMer uses object annotations only during training as a merge prior to discourage cross-instance mixing, requires no ground-truth bounding boxes or detectors at inference time, and adapts only the shared projection layer with frozen vision and language backbones. With K=64, SaMer removes more than 93% of image-side tokens and reduces ColPali storage by 16.09times, while improving R@1 on Flickr30K and MSCOCO. These gains arise because object-aware merging preserves query-selectable object evidence that pruning or feature-only pooling can remove or collapse. SaMer also outperforms compression baselines and shows stronger phrase-level grounding, suggesting that efficient multi-vector retrieval depends not only on reducing token count, but on preserving the evidence future query tokens need to select.