ChatPaper.aiChatPaper

KaLM-Reranker-V1: Interação Rápida, mas não Tardia, para Reordenação de Documentos Comprimidos

KaLM-Reranker-V1: Fast but Not Late Interaction for Compressed Document Reranking

June 22, 2026
Autores: Xinping Zhao, Jiaxin Xu, Ziqi Dai, Xin Zhang, Shouzheng Huang, Danyu Tang, Xinshuo Hu, Meishan Zhang, Baotian Hu, Min Zhang
cs.AI

Resumo

À medida que os sistemas de recuperação escalam, a reordenação de alta qualidade torna-se cada vez mais importante. No entanto, a maioria dos reordenadores existentes, sejam baseados em codificadores ou decodificadores, codifica conjuntamente a consulta e a passagem, acoplando fortemente seu processamento e limitando a eficiência de implantação, bem como a flexibilidade. Apresentamos o KaLM-Reranker-V1, um reordenador rápido, mas não de interação tardia (FBNL), que desacopla o processamento da consulta e da passagem, mantendo uma modelagem expressiva de relevância. Construído sobre uma arquitetura codificador-decodificador, o KaLM-Reranker-V1 utiliza o codificador para pré-codificar passagens com pooling de embeddings Matryoshka, enquanto o decodificador modela a instrução do sistema, a instrução do usuário e a intenção da consulta; a atenção cruzada captura então a relevância entre o contexto da consulta e as representações das passagens. Este design torna o KaLM-Reranker-V1 eficiente por meio da codificação desacoplada de passagens, mas não de interação tardia, preservando uma modelagem rica de relevância por meio da atenção cruzada. Instanciamos o KaLM-Reranker-V1 em três tamanhos: Nano, Small e Large, com 0,27B, 1B e 4B parâmetros ativados, respectivamente. Experimentos extensivos em BEIR, MIRACL e LMEB demonstram que o KaLM-Reranker-V1 alcança um forte desempenho de reordenação com eficiência superior. No BEIR, o KaLM-Reranker-V1 atinge desempenho de estado da arte, comparável a modelos industriais robustos, como a série Qwen3-Reranker; no MIRACL, apesar de não ter sido extensivamente treinado em dados multilíngues, o KaLM-Reranker-V1 ainda demonstra excelente desempenho de reordenação. Além disso, no LMEB, os modelos de reordenação mostram uma clara vantagem, com até mesmo o modelo Nano de 0,27B permanecendo competitivo com modelos de embeddings de 7-12B.
English
As retrieval systems scale, high-quality reranking becomes increasingly important. However, most existing rerankers, whether encoder-based or decoder-based, jointly encode the query and passage, tightly coupling their computation and limiting deployment efficiency as well as flexibility. We present KaLM-Reranker-V1, a fast but not late-interaction (FBNL) reranker that decouples query and passage computation while retaining expressive relevance modeling. Built on an encoder-decoder architecture, KaLM-Reranker-V1 uses the encoder to pre-encode passages with Matryoshka embedding pooling, while the decoder models the system instruction, user instruction, and query intent; cross-attention then captures relevance between the query context and passage representations. This design makes KaLM-Reranker-V1 efficient through decoupled passage encoding, yet not late interaction, by preserving rich relevance modeling through cross-attention. We instantiate KaLM-Reranker-V1 in three sizes, Nano, Small, and Large, with 0.27B, 1B, and 4B activated parameters, respectively. Extensive experiments on BEIR, MIRACL, and LMEB demonstrate that KaLM-Reranker-V1 achieves strong reranking performance with superior efficiency. On BEIR, KaLM-Reranker-V1 achieves state-of-the-art performance, on par with strong industrial models such as the Qwen3-Reranker series; on MIRACL, despite not being extensively trained on multilingual data, KaLM-Reranker-V1 still shows excellent reranking performance. Moreover, on LMEB, reranking models demonstrate a clear advantage, with even the 0.27B Nano model remaining competitive with 7-12B embedding models.