Все ли визуальные токены одинаково важны? Слияние токенов с сохранением объектных свидетельств для визуально-языкового поиска
Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
July 6, 2026
Авторы: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang
cs.AI
Аннотация
Мультивекторный поиск по изображениям и тексту сохраняет детальные визуальные признаки за счёт взаимодействия на позднем этапе с поиском максимального сходства, однако плотные токены на стороне изображения делают хранение и оценку дорогостоящими. Существующие методы сжатия токенов снижают эти затраты, но могут удалять или сворачивать признаки на уровне объектов и регионов, которые могут потребоваться будущим токенам запроса. Мы предлагаем SaMer — объектно-ориентированную структуру объединения токенов, которая сжимает токены после проекции на стороне изображения в K репрезентативных центроидов, сохраняя при этом исходный интерфейс позднего взаимодействия. SaMer использует аннотации объектов только во время обучения в качестве априорной информации для объединения, чтобы предотвратить смешивание между экземплярами, не требует истинных ограничивающих рамок или детекторов на этапе вывода и адаптирует только общий проекционный слой при замороженных магистралях зрения и языка. При K=64 SaMer удаляет более 93% токенов на стороне изображения и сокращает объём хранилища ColPali в 16,09 раза, одновременно улучшая показатель R@1 на наборах данных Flickr30K и MSCOCO. Эти улучшения объясняются тем, что объектно-ориентированное объединение сохраняет выбираемые запросом признаки объектов, которые могут быть удалены или свёрнуты при прореживании или свёртке только на основе признаков. SaMer также превосходит базовые методы сжатия и демонстрирует более сильное фразовое обоснование, что позволяет предположить, что эффективный мультивекторный поиск зависит не только от уменьшения количества токенов, но и от сохранения признаков, которые могут потребоваться будущим токенам запроса для выбора.
English
Multi-vector vision-language retrieval preserves fine-grained visual evidence through maximum-similarity late interaction, but dense image-side tokens make storage and scoring expensive. Existing token compression methods reduce this cost, yet they can remove or collapse object- and region-level evidence that future query tokens may need to select. We propose SaMer, an object-aware token merging framework that compresses image-side post-projector tokens into K representative centroids while preserving the original late-interaction interface. SaMer uses object annotations only during training as a merge prior to discourage cross-instance mixing, requires no ground-truth bounding boxes or detectors at inference time, and adapts only the shared projection layer with frozen vision and language backbones. With K=64, SaMer removes more than 93% of image-side tokens and reduces ColPali storage by 16.09times, while improving R@1 on Flickr30K and MSCOCO. These gains arise because object-aware merging preserves query-selectable object evidence that pruning or feature-only pooling can remove or collapse. SaMer also outperforms compression baselines and shows stronger phrase-level grounding, suggesting that efficient multi-vector retrieval depends not only on reducing token count, but on preserving the evidence future query tokens need to select.