HAKARI-Bench: um benchmark leve para comparar arquiteturas de recuperação e configurações de eficiência sob condições unificadas
HAKARI-Bench: A Lightweight Benchmark for Comparing Retrieval Architectures and Efficiency Settings under Unified Conditions
June 22, 2026
Autores: Yuichi Tateno
cs.AI
Resumo
Com a rápida disseminação da geração aumentada por recuperação e da busca semântica, a escolha da configuração adequada de embeddings e recuperação torna-se cada vez mais difícil. Grandes benchmarks de recuperação são abrangentes, mas pesados demais para serem reexecutados durante o desenvolvimento, e há pouca infraestrutura para comparar configurações de produção — redução de dimensionalidade, quantização, reordenamento — entre muitos modelos sob condições idênticas. Apresentamos o HAKARI-Bench, um benchmark leve que reconstrói suites de recuperação existentes em pequenos conjuntos de dados (Nano-sets): 35 benchmarks e 551 tarefas em 43 idiomas em um formato unificado, permitindo a comparação, sob as mesmas condições e de forma independente do modelo, de cinco famílias de recuperação (BM25, densa, esparsa, interação tardia, reordenadores) e suas variantes de eficiência. Em 55 modelos, sua classificação geral reproduz o MTEB retrieval v2 oficial, o MMTEB v2 retrieval e o English BEIR (completo) com Spearman >0,97. O HAKARI-Bench não substitui a avaliação completa; ele permite seleção rápida de modelos, detecção de regressão e leitura da fronteira Pareto qualidade-eficiência. Código, dados e _leaderboard_ são disponibilizados sob a licença MIT.
English
With the rapid spread of retrieval-augmented generation and semantic search, choosing the right embedding and retrieval configuration is increasingly hard. Large retrieval benchmarks are comprehensive but too heavy to rerun during development, and there is little infrastructure for comparing production settings--dimensionality reduction, quantization, reranking--across many models under identical conditions. We present HAKARI-Bench, a lightweight benchmark that reconstructs existing retrieval suites into small datasets (Nano-sets): 35 benchmarks and 551 tasks across 43 languages in a unified format, enabling same-condition, model-agnostic comparison of five retrieval families (BM25, dense, sparse, late interaction, rerankers) and their efficiency variants. Across 55 models, its overall ranking reproduces the official MTEB retrieval v2, MMTEB v2 retrieval, and English BEIR (full) at Spearman >0.97. HAKARI-Bench does not replace full evaluation; it enables rapid model selection, regression detection, and reading the quality-efficiency Pareto frontier. Code, data, and leaderboard are released under the MIT license.