ChatPaper.aiChatPaper

GRASP: Granulariteitsbewust Zoekbeleid voor Agentische RAG

GRASP: GRanularity-Aware Search Policy for Agentic RAG

July 11, 2026
Auteurs: Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi, Zichao Wang, Andrew Lan
cs.AI

Samenvatting

Agentische retrieval-versterkte generatie (RAG) breidt statische RAG uit door taalmodellen in staat te stellen iteratief te redeneren, zoekopdrachten te genereren, bewijs te verzamelen en antwoorden te voorspellen. Het blijft echter een uitdaging voor modellen om te beslissen wanneer ze moeten opvragen, of ze lexicale matching of semantische gelijkenis moeten gebruiken, en hoe ze de contextgranulariteit kunnen beheersen om te voorkomen dat irrelevante tokens de agent-redenering verstoren. In dit artikel introduceren we GRASP, een reinforcement learning (RL)-framework voor het trainen van agenten om adaptief complementaire opvraagtools te coördineren tijdens meerstapsredeneringen. GRASP voorziet de agent van semantische zoekacties, trefwoordzoekacties en alinea-leesacties, waardoor hij alleen indien nodig bewijs op zinsniveau kan ophalen en verdere context kan uitbreiden. We trainen het beleid met een beloning die gezamenlijk rekening houdt met antwoordnauwkeurigheid, onderbouwd lezen, complementaire zoekacties en beurtefficiëntie. Experimenten op benchmarks voor meerstapsredeneringen tonen aan dat GRASP zowel de retrieval-recall als de downstream-vraagbeantwoordingsprestaties verbetert in vergelijking met enkelstaps-retrieval, prompt-gebaseerde agentische RAG, en op RL gebaseerde retrieval-baselines. Kwalitatieve en ablatie-analyses laten zien dat het aangeleerde beleid interpreteerbaar skim- en scan-gedrag ontwikkelt: het gebruikt semantisch zoeken voor brede verkenning, alinea-lezen voor lokale verificatie, en trefwoordzoeken voor entiteit-specifiek bewijs. Deze resultaten suggereren dat het leren coördineren van retrievalsignalen en contextgranulariteit cruciaal is voor correcte redenering van de agent.
English
Agentic retrieval-augmented generation (RAG) extends static RAG by allowing language models to iteratively reason, generate search queries, retrieve evidence, and predict answers. However, it remains challenging for models to decide when to retrieve, whether to use lexical matching or semantic similarity, and how to control context granularity to prevent irrelevant tokens from interfering with agent reasoning. In this paper, we introduce GRASP, a reinforcement learning (RL) framework for training agents to adaptively coordinate complementary retrieval tools during multi-step reasoning. GRASP provides the agent with semantic search, keyword search, and paragraph-reading actions, enabling it to retrieve sentence-level evidence and expand further context only when needed. We train the policy with a reward that jointly accounts for answer accuracy, grounded reading, complementary search, and turn efficiency. Experiments on multi-hop reasoning benchmarks show that GRASP improves both retrieval recall and downstream question answering performance compared with single-step retrieval, prompting-based agentic RAG, and RL-based retrieval baselines. Qualitative and ablation analyses show that the learned policy develops interpretable skimming and scanning behavior: it uses semantic search for broad exploration, paragraph reading for local verification, and keyword search for entity-specific evidence. These results suggest that learning to coordinate retrieval signals and context granularity is critical for agent's correct reasoning.