Repensando a Busca Agêntica com Pi-Serini: A Recuperação Lexical é Suficiente?
Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?
May 11, 2026
Autores: Tz-Huan Hsu, Jheng-Hong Yang, Jimmy Lin
cs.AI
Resumo
Um recuperador lexical é suficiente à medida que os modelos de linguagem de grande escala (LLMs) se tornam mais capazes em um ciclo agentivo? Essa pergunta surge naturalmente ao construir sistemas de pesquisa aprofundada. Revisitamos essa questão combinando o BM25 com LLMs de ponta que possuem melhores capacidades de raciocínio e uso de ferramentas. Para apoiar pesquisadores que fazem a mesma pergunta, apresentamos o Pi-Serini, um agente de busca equipado com três ferramentas para recuperar, navegar e ler documentos. Nossos resultados mostram que, no BrowseComp-Plus, um recuperador lexical bem configurado com profundidade de recuperação suficiente pode suportar uma pesquisa aprofundada eficaz quando combinado com LLMs mais capazes. Especificamente, o Pi-Serini com gpt-5.5 alcança 83,1% de acurácia nas respostas e 94,7% de recall de evidências recuperadas, superando agentes de busca publicados que usam recuperadores densos. Ablações controladas mostram ainda que o ajuste do BM25 melhora a acurácia das respostas em 18,0% e o recall de evidências recuperadas em 11,1% em relação à configuração padrão do BM25, enquanto o aumento da profundidade de recuperação melhora ainda mais o recall de evidências recuperadas em 25,3% em relação à configuração de recuperação rasa. O código-fonte está disponível em https://github.com/justram/pi-serini.
English
Does a lexical retriever suffice as large language models (LLMs) become more capable in an agentic loop? This question naturally arises when building deep research systems. We revisit it by pairing BM25 with frontier LLMs that have better reasoning and tool-use abilities. To support researchers asking the same question, we introduce Pi-Serini, a search agent equipped with three tools for retrieving, browsing, and reading documents. Our results show that, on BrowseComp-Plus, a well-configured lexical retriever with sufficient retrieval depth can support effective deep research when paired with more capable LLMs. Specifically, Pi-Serini with gpt-5.5 achieves 83.1% answer accuracy and 94.7% surfaced evidence recall, outperforming released search agents that use dense retrievers. Controlled ablations further show that BM25 tuning improves answer accuracy by 18.0% and surfaced evidence recall by 11.1% over the default BM25 setting, while increasing retrieval depth further improves surfaced evidence recall by 25.3% over the shallow-retrieval setting. Source code is available at https://github.com/justram/pi-serini.