ChatPaper.aiChatPaper

GRASP : Politique de recherche consciente de la granularité pour le RAG agentique

GRASP: GRanularity-Aware Search Policy for Agentic RAG

July 11, 2026
Auteurs: Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi, Zichao Wang, Andrew Lan
cs.AI

Résumé

La génération augmentée par récupération agentique (RAG) étend le RAG statique en permettant aux modèles de langage de raisonner itérativement, de générer des requêtes de recherche, de récupérer des preuves et de prédire des réponses. Cependant, il reste difficile pour les modèles de décider quand récupérer, d'utiliser une correspondance lexicale ou une similarité sémantique, et comment contrôler la granularité du contexte pour éviter que des tokens non pertinents n'interfèrent avec le raisonnement de l'agent. Dans cet article, nous présentons GRASP, un cadre d'apprentissage par renforcement (RL) pour entraîner des agents à coordonner de manière adaptative des outils de récupération complémentaires lors d'un raisonnement multi-étapes. GRASP fournit à l'agent des actions de recherche sémantique, de recherche par mots-clés et de lecture de paragraphes, lui permettant de récupérer des preuves au niveau de la phrase et d'étendre le contexte supplémentaire uniquement lorsque cela est nécessaire. Nous entraînons la politique avec une récompense qui prend en compte conjointement la précision des réponses, la lecture fondée sur des preuves, la recherche complémentaire et l'efficacité des tours. Les expériences sur des benchmarks de raisonnement multi-sauts montrent que GRASP améliore à la fois le rappel de récupération et les performances de réponse aux questions en aval par rapport à la récupération en une seule étape, au RAG agentique basé sur des invites, et aux lignes de base de récupération basées sur RL. Les analyses qualitatives et d'ablation montrent que la politique apprise développe un comportement interprétable de survol et de balayage : elle utilise la recherche sémantique pour une exploration large, la lecture de paragraphes pour une vérification locale, et la recherche par mots-clés pour des preuves spécifiques à une entité. Ces résultats suggèrent qu'apprendre à coordonner les signaux de récupération et la granularité du contexte est crucial pour le raisonnement correct de l'agent.
English
Agentic retrieval-augmented generation (RAG) extends static RAG by allowing language models to iteratively reason, generate search queries, retrieve evidence, and predict answers. However, it remains challenging for models to decide when to retrieve, whether to use lexical matching or semantic similarity, and how to control context granularity to prevent irrelevant tokens from interfering with agent reasoning. In this paper, we introduce GRASP, a reinforcement learning (RL) framework for training agents to adaptively coordinate complementary retrieval tools during multi-step reasoning. GRASP provides the agent with semantic search, keyword search, and paragraph-reading actions, enabling it to retrieve sentence-level evidence and expand further context only when needed. We train the policy with a reward that jointly accounts for answer accuracy, grounded reading, complementary search, and turn efficiency. Experiments on multi-hop reasoning benchmarks show that GRASP improves both retrieval recall and downstream question answering performance compared with single-step retrieval, prompting-based agentic RAG, and RL-based retrieval baselines. Qualitative and ablation analyses show that the learned policy develops interpretable skimming and scanning behavior: it uses semantic search for broad exploration, paragraph reading for local verification, and keyword search for entity-specific evidence. These results suggest that learning to coordinate retrieval signals and context granularity is critical for agent's correct reasoning.