Cuantificando y expandiendo la capacidad teórica de los modelos de recuperación de interacción tardía
Quantifying and Expanding the Theoretical Capacity of Late-Interaction Retrieval Models
July 7, 2026
Autores: Julian Killingback, Varad Ingale, Hamed Zamani, Cameron Musco
cs.AI
Resumen
Los modelos de recuperación de interacción tardía que utilizan la función de similitud MaxSim han demostrado un sólido rendimiento empírico, superando con frecuencia a los modelos de recuperación densos y dispersos de un solo vector. A pesar de estos hallazgos empíricos, se sabe poco sobre el poder de representación teórica de MaxSim y cómo se compara con otros enfoques de recuperación. Este artículo demuestra, mediante construcción, que la similitud MaxSim puede replicar exactamente el producto interno entre dos vectores no negativos k-dispersos de dimensión posiblemente infinita, requiriendo solo un espacio de representación O(k). Además, existen similitudes que MaxSim puede expresar mientras que los productos internos vectoriales estándar con el mismo espacio de representación no pueden. Aprovechando nuestro marco teórico, introducimos MaxSim con signo, que permite a los modelos de interacción tardía replicar exactamente cualquier producto interno con valores reales, algo que demostramos que el MaxSim estándar no es capaz de hacer. También mostramos que MaxSim puede actuar como una agregación de operaciones soft-OR y como un evaluador de expresiones lógicas en Forma Normal Conjuntiva positiva. Nuestros hallazgos muestran que MaxSim es al menos tan capaz como los productos internos vectoriales estándar para cualquier vector no negativo, y nuestra extensión, MaxSim con signo, lo es para cualquier vector. Ambas similitudes poseen capacidades adicionales que el producto interno no puede replicar, lo que marca una de las primeras justificaciones teóricas y cuantificaciones de los métodos de interacción tardía. Nuestros hallazgos teóricos están respaldados empíricamente: en una tarea de recuperación con consultas que incluyen negaciones, MaxSim con signo mejora significativamente el rendimiento fuera del dominio en comparación con una línea base estándar de ColBERT/MaxSim, con un aumento del nDCG@10 de 0.597 a 1.000 bajo un cambio de vocabulario y de 0.008 a 0.788 en consultas solo con negación.
English
Late-interaction retrieval models that use the MaxSim similarity function have shown strong empirical performance, often outperforming single-vector dense and sparse retrieval models. Despite these empirical findings, little is known about the theoretical representation power of MaxSim and how it compares to other retrieval approaches. This paper shows by construction that MaxSim similarity can exactly replicate the inner product between any two non-negative k-sparse vectors with possibly infinite dimension, requiring only O(k) representation space. Moreover, there exist similarities that MaxSim can express while standard vector inner products with the same representation space cannot. Leveraging our theoretical framework, we introduce Signed MaxSim which allows late-interaction models to exactly replicate any real-valued inner product, something we prove standard MaxSim is not capable of. We also show that MaxSim can act as an aggregation of soft-OR operations and as an evaluator of logical expressions in positive Conjunctive Normal Form. Our findings show that MaxSim is at least as capable as standard vector inner products for any non-negative vectors and our extension, Signed MaxSim, is as capable for any vectors. Both similarities possess additional capabilities that inner product cannot replicate, marking one of the first theoretical justifications and quantifications of late-interaction methods. Our theoretical findings are supported empirically: on a retrieval task featuring queries with negations, Signed MaxSim improves out-of-domain performance significantly over a standard ColBERT/MaxSim baseline with nDCG@10 increasing from 0.597 to 1.000 under a vocabulary shift and from 0.008 to 0.788 on negation-only queries.