Opnieuw Denken over Agentisch Zoeken met Pi-Serini: Is Lexicale Retrieval Voldoende?
Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?
May 11, 2026
Auteurs: Tz-Huan Hsu, Jheng-Hong Yang, Jimmy Lin
cs.AI
Samenvatting
Volstaat een lexicale retriever wanneer grote taalmodelen (LLM's) beter worden in een agentische loop? Deze vraag komt vanzelfsprekend naar voren bij het bouwen van diepe onderzoekssystemen. Wij onderzoeken dit opnieuw door BM25 te combineren met geavanceerde LLM's die betere redeneer- en toolgebruikvaardigheden hebben. Om onderzoekers te ondersteunen die dezelfde vraag stellen, introduceren we Pi-Serini, een zoekagent uitgerust met drie tools voor het ophalen, doorbladeren en lezen van documenten. Onze resultaten tonen aan dat op BrowseComp-Plus een goed geconfigureerde lexicale retriever met voldoende ophaaldiepte effectief diep onderzoek kan ondersteunen in combinatie met capabelere LLM's. Specifiek behaalt Pi-Serini met gpt-5.5 een antwoornauwkeurigheid van 83,1% en een recall van blootgelegd bewijs van 94,7%, wat beter presteert dan vrijgegeven zoekagentschappen die dense retrievers gebruiken. Gecontroleerde ablatieonderzoeken laten verder zien dat BM25-optimalisatie de antwoornauwkeurigheid met 18,0% verbetert en de recall van blootgelegd bewijs met 11,1% ten opzichte van de standaard BM25-instelling, terwijl een grotere ophaaldiepte de recall van blootgelegd bewijs met 25,3% verbetert ten opzichte van de instelling met ondiepe retrievals. De broncode is beschikbaar op https://github.com/justram/pi-serini.
English
Does a lexical retriever suffice as large language models (LLMs) become more capable in an agentic loop? This question naturally arises when building deep research systems. We revisit it by pairing BM25 with frontier LLMs that have better reasoning and tool-use abilities. To support researchers asking the same question, we introduce Pi-Serini, a search agent equipped with three tools for retrieving, browsing, and reading documents. Our results show that, on BrowseComp-Plus, a well-configured lexical retriever with sufficient retrieval depth can support effective deep research when paired with more capable LLMs. Specifically, Pi-Serini with gpt-5.5 achieves 83.1% answer accuracy and 94.7% surfaced evidence recall, outperforming released search agents that use dense retrievers. Controlled ablations further show that BM25 tuning improves answer accuracy by 18.0% and surfaced evidence recall by 11.1% over the default BM25 setting, while increasing retrieval depth further improves surfaced evidence recall by 25.3% over the shallow-retrieval setting. Source code is available at https://github.com/justram/pi-serini.