ChatPaper.aiChatPaper

GRASP: Política de búsqueda consciente de granularidad para RAG agéntico

GRASP: GRanularity-Aware Search Policy for Agentic RAG

July 11, 2026
Autores: Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi, Zichao Wang, Andrew Lan
cs.AI

Resumen

La generación aumentada por recuperación (RAG) agente extiende la RAG estática al permitir que los modelos de lenguaje razonen, generen consultas de búsqueda, recuperen evidencia y predigan respuestas de forma iterativa. Sin embargo, sigue siendo un desafío que los modelos decidan cuándo recuperar, si utilizar coincidencias léxicas o similitud semántica, y cómo controlar la granularidad del contexto para evitar que tokens irrelevantes interfieran en el razonamiento del agente. En este artículo, presentamos GRASP, un marco de aprendizaje por refuerzo (RL) para entrenar agentes que coordinen de manera adaptativa herramientas de recuperación complementarias durante el razonamiento multi-paso. GRASP proporciona al agente acciones de búsqueda semántica, búsqueda por palabras clave y lectura de párrafos, lo que le permite recuperar evidencia a nivel de oración y expandir el contexto adicional solo cuando sea necesario. Entrenamos la política con una recompensa que considera conjuntamente la precisión de la respuesta, la lectura fundamentada, la búsqueda complementaria y la eficiencia en los turnos. Los experimentos en puntos de referencia de razonamiento multi-paso muestran que GRASP mejora tanto la recuperación de recuerdo como el rendimiento de respuesta a preguntas en comparación con la recuperación de un solo paso, la RAG agente basada en indicaciones y las líneas base de recuperación basadas en RL. Los análisis cualitativos y de ablación muestran que la política aprendida desarrolla un comportamiento interpretable de hojeo y escaneo: utiliza la búsqueda semántica para una exploración amplia, la lectura de párrafos para la verificación local y la búsqueda por palabras clave para evidencia específica de entidades. Estos resultados sugieren que aprender a coordinar las señales de recuperación y la granularidad del contexto es fundamental para el razonamiento correcto del agente.
English
Agentic retrieval-augmented generation (RAG) extends static RAG by allowing language models to iteratively reason, generate search queries, retrieve evidence, and predict answers. However, it remains challenging for models to decide when to retrieve, whether to use lexical matching or semantic similarity, and how to control context granularity to prevent irrelevant tokens from interfering with agent reasoning. In this paper, we introduce GRASP, a reinforcement learning (RL) framework for training agents to adaptively coordinate complementary retrieval tools during multi-step reasoning. GRASP provides the agent with semantic search, keyword search, and paragraph-reading actions, enabling it to retrieve sentence-level evidence and expand further context only when needed. We train the policy with a reward that jointly accounts for answer accuracy, grounded reading, complementary search, and turn efficiency. Experiments on multi-hop reasoning benchmarks show that GRASP improves both retrieval recall and downstream question answering performance compared with single-step retrieval, prompting-based agentic RAG, and RL-based retrieval baselines. Qualitative and ablation analyses show that the learned policy develops interpretable skimming and scanning behavior: it uses semantic search for broad exploration, paragraph reading for local verification, and keyword search for entity-specific evidence. These results suggest that learning to coordinate retrieval signals and context granularity is critical for agent's correct reasoning.