ChatPaper.aiChatPaper

GRASP: Политика поиска с учетом гранулярности для агентного RAG

GRASP: GRanularity-Aware Search Policy for Agentic RAG

July 11, 2026
Авторы: Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi, Zichao Wang, Andrew Lan
cs.AI

Аннотация

Агентная генерация с дополнением поиска (RAG) расширяет статический RAG, позволяя языковым моделям итеративно рассуждать, генерировать поисковые запросы, извлекать свидетельства и предсказывать ответы. Однако моделям по-прежнему сложно решать, когда выполнять поиск, использовать ли лексическое соответствие или семантическое сходство, а также контролировать гранулярность контекста, чтобы избежать помех от нерелевантных токенов в процессе рассуждений агента. В данной статье мы представляем GRASP — фреймворк обучения с подкреплением (RL) для тренировки агентов, способных адаптивно координировать взаимодополняющие инструменты поиска в ходе многошаговых рассуждений. GRASP предоставляет агенту действия семантического поиска, поиска по ключевым словам и чтения абзацев, что позволяет ему извлекать свидетельства на уровне предложений и расширять контекст только при необходимости. Мы обучаем политику с вознаграждением, которое совместно учитывает точность ответа, обоснованное чтение, взаимодополняющий поиск и эффективность шагов. Эксперименты на эталонах многошаговых рассуждений показывают, что GRASP улучшает как полноту поиска, так и производительность нисходящего ответа на вопросы по сравнению с одношаговым поиском, подсказочным агентным RAG и базовыми методами поиска на основе RL. Качественный анализ и анализ абляций показывают, что изученная политика развивает интерпретируемое поведение беглого просмотра и сканирования: она использует семантический поиск для широкого исследования, чтение абзацев для локальной проверки и поиск по ключевым словам для обнаружения свидетельств, специфичных для сущностей. Эти результаты позволяют предположить, что обучение координации сигналов поиска и гранулярности контекста критически важно для правильных рассуждений агента.
English
Agentic retrieval-augmented generation (RAG) extends static RAG by allowing language models to iteratively reason, generate search queries, retrieve evidence, and predict answers. However, it remains challenging for models to decide when to retrieve, whether to use lexical matching or semantic similarity, and how to control context granularity to prevent irrelevant tokens from interfering with agent reasoning. In this paper, we introduce GRASP, a reinforcement learning (RL) framework for training agents to adaptively coordinate complementary retrieval tools during multi-step reasoning. GRASP provides the agent with semantic search, keyword search, and paragraph-reading actions, enabling it to retrieve sentence-level evidence and expand further context only when needed. We train the policy with a reward that jointly accounts for answer accuracy, grounded reading, complementary search, and turn efficiency. Experiments on multi-hop reasoning benchmarks show that GRASP improves both retrieval recall and downstream question answering performance compared with single-step retrieval, prompting-based agentic RAG, and RL-based retrieval baselines. Qualitative and ablation analyses show that the learned policy develops interpretable skimming and scanning behavior: it uses semantic search for broad exploration, paragraph reading for local verification, and keyword search for entity-specific evidence. These results suggest that learning to coordinate retrieval signals and context granularity is critical for agent's correct reasoning.