Repensando a Recuperação Intensiva em Raciocínio: Avaliando e Avançando Mecanismos de Recuperação em Sistemas de Busca Agênticos
Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
May 5, 2026
Autores: Yilun Zhao, Jinbiao Wei, Tingyu Song, Siyue Zhang, Chen Zhao, Arman Cohan
cs.AI
Resumo
A recuperação intensiva em raciocínio visa encontrar evidências que sustentem o raciocínio subsequente, em vez de apenas corresponder à similaridade temática. Essa capacidade é cada vez mais importante para sistemas de busca agentivos, nos quais os recuperadores devem fornecer evidências complementares ao longo de buscas e sínteses iterativas. No entanto, o trabalho existente ainda é limitado tanto na avaliação quanto no treinamento: benchmarks como o BRIGHT fornecem conjuntos de ouro restritos e avaliam os recuperadores de forma isolada, enquanto corpora sintéticos de treinamento frequentemente otimizam a relevância de passagem única em vez da construção de um portfólio de evidências. Apresentamos o BRIGHT-Pro, um benchmark anotado por especialistas que expande cada consulta com evidências de ouro multi-aspectos e avalia os recuperadores sob protocolos de busca estáticos e agentivos. Além disso, construímos o RTriever-Synth, um corpus sintético decomposto por aspectos que gera positivos complementares e negativos difíceis condicionados a positivos, e o utilizamos para ajustar via LoRA o RTriever-4B, derivado do Qwen3-Embedding-4B. Experimentos com recuperadores léxicos, de propósito geral e intensivos em raciocínio mostram que a avaliação consciente dos aspectos e agentiva revela comportamentos ocultos pelas métricas padrão, enquanto o RTriever-4B melhora substancialmente seu modelo base.
English
Reasoning-intensive retrieval aims to surface evidence that supports downstream reasoning rather than merely matching topical similarity. This capability is increasingly important for agentic search systems, where retrievers must provide complementary evidence across iterative search and synthesis. However, existing work remains limited on both evaluation and training: benchmarks such as BRIGHT provide narrow gold sets and evaluate retrievers in isolation, while synthetic training corpora often optimize single-passage relevance rather than evidence portfolio construction. We introduce BRIGHT-Pro, an expert-annotated benchmark that expands each query with multi-aspect gold evidence and evaluates retrievers under both static and agentic search protocols. We further construct RTriever-Synth, an aspect-decomposed synthetic corpus that generates complementary positives and positive-conditioned hard negatives, and use it to LoRA fine-tune RTriever-4B from Qwen3-Embedding-4B. Experiments across lexical, general-purpose, and reasoning-intensive retrievers show that aspect-aware and agentic evaluation expose behaviors hidden by standard metrics, while RTriever-4B substantially improves over its base model.