Q-RAG: Recuperação de Múltiplas Etapas em Contexto Longo via Treinamento de Embedder Baseado em Valor
Q-RAG: Long Context Multi-step Retrieval via Value-based Embedder Training
May 4, 2026
Autores: Artyom Sorokin, Nazar Buzun, Alexander Anokhin, Oleg Inozemcev, Egor Vedernikov, Petr Anokhin, Mikhail Burtsev, Trushkov Alexey, Yin Wenshuai, Evgeny Burnaev
cs.AI
Resumo
Os métodos de Geração Aumentada por Recuperação (RAG) melhoram o desempenho dos LLMs ao filtrar eficientemente o contexto relevante para os LLMs, reduzindo alucinações e o custo de inferência. No entanto, a maioria dos métodos RAG existentes concentra-se na recuperação de etapa única, o que muitas vezes é insuficiente para responder a perguntas complexas que exigem busca em múltiplas etapas. Recentemente, surgiram abordagens de recuperação em múltiplas etapas, que geralmente envolvem o ajuste fino de LLMs pequenos para realizar a recuperação em múltiplas etapas. Esse tipo de ajuste fino é altamente intensivo em recursos e não permite o uso de LLMs maiores. Neste trabalho, propomos o Q-RAG, uma abordagem inovadora que ajusta o modelo Embedder para recuperação em múltiplas etapas usando aprendizado por reforço (RL). O Q-RAG oferece uma alternativa competitiva e eficiente em recursos aos métodos existentes de recuperação em múltiplas etapas para resposta a perguntas em domínio aberto e alcança resultados de ponta nos populares benchmarks de contexto longo BabiLong e RULER para contextos de até 10 milhões de tokens. O código está disponível em https://github.com/griver/Q-RAG.
English
Retrieval-Augmented Generation (RAG) methods enhance LLM performance by efficiently filtering relevant context for LLMs, reducing hallucinations and inference cost. However, most existing RAG methods focus on single-step retrieval, which is often insufficient for answering complex questions that require multi-step search. Recently, multi-step retrieval approaches have emerged, typically involving the fine-tuning of small LLMs to perform multi-step retrieval. This type of fine-tuning is highly resource-intensive and does not enable the use of larger LLMs. In this work, we propose Q-RAG, a novel approach that fine-tunes the Embedder model for multi-step retrieval using reinforcement learning (RL). Q-RAG offers a competitive, resource-efficient alternative to existing multi-step retrieval methods for open-domain question answering and achieves state-of-the-art results on the popular long-context benchmarks BabiLong and RULER for contexts up to 10M tokens. Code is available at https://github.com/griver/Q-RAG