RL-Index: Aprendizagem por Reforço para Raciocínio de Índice de Recuperação
RL-Index: Reinforcement Learning for Retrieval Index Reasoning
June 15, 2026
Autores: Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang
cs.AI
Resumo
Recuperar conhecimento externo é essencial para resolver tarefas do mundo real, no entanto, continua a ser desafiador quando a relação entre uma consulta e o conhecimento relevante envolve raciocínio implícito e complexo, além da correspondência semântica ou lexical de superfície (por exemplo, problemas matemáticos que dependem do mesmo teorema ou codificação que exige raciocínio aprofundado). As abordagens existentes baseiam-se principalmente no raciocínio do lado da consulta (por exemplo, reescrita de consultas), o que introduz latência online significativa e subutiliza a oportunidade de realizar raciocínio sobre o próprio corpus de conhecimento (ou seja, raciocínio do lado do índice). Neste artigo, propomos o RL-Index, uma estrutura de indexação agentiva que formula o raciocínio do índice de recuperação como um problema de aprendizado por reforço. Em vez de realizar raciocínio no momento da consulta, o RL-Index desloca o raciocínio para a etapa de indexação, aumentando os documentos com justificativas geradas por LLM que codificam explicitamente a relação latente entre consulta e conhecimento. Para otimizar a qualidade dessas justificativas, empregamos a Otimização Relativa de Política em Grupo (GRPO) e usamos a similaridade de recuperação como um sinal de recompensa verificável, permitindo a otimização direta das decisões de indexação para a eficácia da recuperação. Experimentos extensivos no benchmark BRIGHT demonstram que o RL-Index melhora consistentemente tanto o desempenho da recuperação quanto o da resposta a perguntas a jusante, ao mesmo tempo que reduz significativamente a latência de inferência online. Além disso, o aumento aprendido por justificativas se generaliza para diversos recuperadores e geradores, destacando sua robustez como uma estratégia de indexação plug-and-play em diferentes sistemas de recuperação.
English
Retrieving external knowledge is essential for solving real-world tasks, yet it remains challenging when the relationship between a query and its relevant knowledge involves implicit and complex reasoning beyond surface-level semantic or lexical matching (e.g., mathematical problems relying on the same theorem or coding requiring deep reasoning). Existing approaches primarily rely on query-side reasoning (e.g., query rewriting), which introduces significant online latency and underutilizes the opportunity to perform reasoning over the knowledge corpus itself (i.e., index-side reasoning). In this paper, we propose RL-Index, an agentic indexing framework that formulates retrieval index reasoning as a reinforcement learning problem. Instead of performing reasoning at query time, RL-Index shifts reasoning to the indexing stage by augmenting documents with LLM-generated rationales that explicitly encode the latent query-knowledge relationship. To optimize the quality of these rationales, we employ Group Relative Policy Optimization (GRPO) and use retrieval similarity as a verifiable reward signal, enabling direct optimization of indexing decisions for retrieval effectiveness. Extensive experiments on the BRIGHT benchmark demonstrate that RL-Index consistently improves both retrieval and downstream question-answering performance, while significantly reducing online inference latency. Moreover, the learned rationale augmentation generalizes across diverse retrievers and generators, highlighting its robustness as a plug-and-play indexing strategy across different retrieval systems.