Количественная оценка и расширение теоретической ёмкости моделей позднего взаимодействия
Quantifying and Expanding the Theoretical Capacity of Late-Interaction Retrieval Models
July 7, 2026
Авторы: Julian Killingback, Varad Ingale, Hamed Zamani, Cameron Musco
cs.AI
Аннотация
Модели поиска с поздним взаимодействием, использующие функцию сходства MaxSim, демонстрируют высокую эмпирическую эффективность, часто превосходя одновекторные плотные и разреженные модели поиска. Несмотря на эти эмпирические результаты, теоретическая выразительная способность MaxSim и ее сравнение с другими подходами к поиску остаются малоизученными. В данной работе путем конструктивного построения показано, что сходство MaxSim может в точности воспроизводить скалярное произведение между любыми двумя неотрицательными k-разреженными векторами, возможно бесконечной размерности, требуя при этом лишь O(k) пространства для представления. Более того, существуют сходства, которые MaxSim способен выразить, в то время как стандартные скалярные произведения векторов с тем же пространством представления — нет. Используя нашу теоретическую основу, мы вводим Signed MaxSim, который позволяет моделям позднего взаимодействия в точности воспроизводить любое вещественное скалярное произведение, что, как мы доказываем, невозможно для стандартного MaxSim. Мы также показываем, что MaxSim может выступать в роли агрегации операций мягкой дизъюнкции (soft-OR) и как оценщик логических выражений в положительной конъюнктивной нормальной форме. Наши результаты свидетельствуют о том, что MaxSim как минимум так же выразителен, как стандартные скалярные произведения векторов для любых неотрицательных векторов, а наше расширение, Signed MaxSim, — для любых векторов. Обе функции сходства обладают дополнительными возможностями, которые скалярное произведение воспроизвести не способно, что является одним из первых теоретических обоснований и количественных оценок методов позднего взаимодействия. Наши теоретические выводы подкреплены эмпирически: в задаче поиска с запросами, содержащими отрицания, Signed MaxSim значительно улучшает производительность на данных из других предметных областей по сравнению с базовым методом ColBERT/MaxSim: nDCG@10 возрастает с 0,597 до 1,000 при сдвиге словаря и с 0,008 до 0,788 на запросах, содержащих только отрицания.
English
Late-interaction retrieval models that use the MaxSim similarity function have shown strong empirical performance, often outperforming single-vector dense and sparse retrieval models. Despite these empirical findings, little is known about the theoretical representation power of MaxSim and how it compares to other retrieval approaches. This paper shows by construction that MaxSim similarity can exactly replicate the inner product between any two non-negative k-sparse vectors with possibly infinite dimension, requiring only O(k) representation space. Moreover, there exist similarities that MaxSim can express while standard vector inner products with the same representation space cannot. Leveraging our theoretical framework, we introduce Signed MaxSim which allows late-interaction models to exactly replicate any real-valued inner product, something we prove standard MaxSim is not capable of. We also show that MaxSim can act as an aggregation of soft-OR operations and as an evaluator of logical expressions in positive Conjunctive Normal Form. Our findings show that MaxSim is at least as capable as standard vector inner products for any non-negative vectors and our extension, Signed MaxSim, is as capable for any vectors. Both similarities possess additional capabilities that inner product cannot replicate, marking one of the first theoretical justifications and quantifications of late-interaction methods. Our theoretical findings are supported empirically: on a retrieval task featuring queries with negations, Signed MaxSim improves out-of-domain performance significantly over a standard ColBERT/MaxSim baseline with nDCG@10 increasing from 0.597 to 1.000 under a vocabulary shift and from 0.008 to 0.788 on negation-only queries.