ChatPaper.aiChatPaper

Wanneer zoekagenten moeten vragen: DiscoBench voor verduidelijkingsbewust diepgaand zoeken

When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search

June 26, 2026
Auteurs: Yiling Tao, Shihan Deng, Meiling Tao, Pengzhi Wei, Zhichao Hu, Zhihao Zhu
cs.AI

Samenvatting

Zoekagenten die worden aangedreven door grote taalmodellen (LLM's) worden steeds vaker ingezet om complexe informatiezoekopdrachten uit te voeren, waarbij meerdere stappen van ophalen en redeneren nodig zijn om gebruikersdoelen te vervullen. Bestaande benchmarks gaan echter vaak uit van volledige en expliciete gebruikersvragen, waardoor over het hoofd wordt gezien dat zoekopdrachten in de praktijk vaak vaag, ondergespecificeerd of zelfs feitelijk onjuist zijn. In diepe zoekscenario's kan dergelijke ambiguïteit zich voortplanten over meerstaps redeneerketens en agenten naar verkeerde zoektrajecten leiden. Om deze leemte aan te pakken introduceren we DiscoBench, een benchmark voor verduidelijkingsbewust diep zoeken, ontworpen om te evalueren of zoekagenten proactief ambiguïteit kunnen identificeren, effectieve verduidelijkingsvragen kunnen stellen en correcte redeneerpaden kunnen herstellen via gebruikersinteractie. DiscoBench bevat 211 monsters en 463 ambiguïteitsgevallen uit 11 realistische domeinen, die vier typen ambiguïteit bestrijken. Verder ontwerpen we een gebruikerssimulator voor meerstaps interactie en evalueren we de modelprestaties vanuit vier perspectieven: taaknut, ambiguïteitsdetectie, interactiestrategie en kostenefficiëntie. Experimenten met representatieve LLM's tonen aan dat ambiguïteitsdetectie en effectieve verduidelijking afzonderlijke vaardigheden zijn, en dat herhaaldelijk zoeken in plaats van om verduidelijking vragen vaak slechter presteert dan direct raden, wat een kritieke kloof benadrukt tussen retrievalvermogen en interactief probleemoplossend vermogen in huidige zoekagenten.
English
Search agents powered by large language models (LLMs) are increasingly used to solve complex information-seeking tasks, requiring multi-step retrieval and reasoning to fulfill user goals. However, existing benchmarks often assume that user queries are complete and explicit, overlooking the fact that real-world search requests are frequently vague, underspecified, or even factually incorrect. In deep search scenarios, such ambiguity can propagate along multi-step reasoning chains and lead agents toward incorrect search trajectories. To address this gap, we introduce DiscoBench, a benchmark for clarification-aware deep search, designed to evaluate whether search agents can proactively identify ambiguity, ask effective clarification questions, and recover correct reasoning paths through user interaction. DiscoBench contains 211 samples and 463 ambiguity instances across 11 real-world domains, covering four ambiguity types. We further design a user simulator for multi-turn interaction and evaluate model performance from four perspectives: task utility, ambiguity detection, interaction strategy, and cost efficiency. Experiments on representative LLMs show that ambiguity detection and effective clarification are distinct capabilities, and that repeatedly searching instead of asking for clarification often performs worse than direct guessing, highlighting a critical gap between retrieval ability and interactive problem-solving in current search agents.