Quando Agentes de Busca Devem Perguntar: DiscoBench para Busca Profunda Consciente de Esclarecimento
When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
June 26, 2026
Autores: Yiling Tao, Shihan Deng, Meiling Tao, Pengzhi Wei, Zhichao Hu, Zhihao Zhu
cs.AI
Resumo
Agentes de busca impulsionados por grandes modelos de linguagem (LLMs) são cada vez mais utilizados para resolver tarefas complexas de busca de informações, exigindo recuperação e raciocínio em múltiplas etapas para atender aos objetivos do usuário. No entanto, benchmarks existentes frequentemente assumem que as consultas dos usuários são completas e explícitas, ignorando o fato de que as solicitações de busca no mundo real são frequentemente vagas, subespecificadas ou até mesmo factualmente incorretas. Em cenários de busca profunda, tal ambiguidade pode se propagar ao longo de cadeias de raciocínio em múltiplas etapas e levar os agentes a trajetórias de busca incorretas. Para preencher essa lacuna, apresentamos o DiscoBench, um benchmark para busca profunda ciente de esclarecimento, projetado para avaliar se os agentes de busca conseguem identificar proativamente ambiguidades, fazer perguntas de esclarecimento eficazes e recuperar caminhos de raciocínio corretos por meio da interação com o usuário. O DiscoBench contém 211 amostras e 463 instâncias de ambiguidade em 11 domínios do mundo real, abrangendo quatro tipos de ambiguidade. Além disso, projetamos um simulador de usuário para interação em múltiplas rodadas e avaliamos o desempenho do modelo sob quatro perspectivas: utilidade da tarefa, detecção de ambiguidade, estratégia de interação e eficiência de custo. Experimentos em LLMs representativos mostram que a detecção de ambiguidade e o esclarecimento eficaz são capacidades distintas, e que buscar repetidamente em vez de pedir esclarecimento muitas vezes tem desempenho pior do que o palpite direto, destacando uma lacuna crítica entre a capacidade de recuperação e a resolução interativa de problemas nos agentes de busca atuais.
English
Search agents powered by large language models (LLMs) are increasingly used to solve complex information-seeking tasks, requiring multi-step retrieval and reasoning to fulfill user goals. However, existing benchmarks often assume that user queries are complete and explicit, overlooking the fact that real-world search requests are frequently vague, underspecified, or even factually incorrect. In deep search scenarios, such ambiguity can propagate along multi-step reasoning chains and lead agents toward incorrect search trajectories. To address this gap, we introduce DiscoBench, a benchmark for clarification-aware deep search, designed to evaluate whether search agents can proactively identify ambiguity, ask effective clarification questions, and recover correct reasoning paths through user interaction. DiscoBench contains 211 samples and 463 ambiguity instances across 11 real-world domains, covering four ambiguity types. We further design a user simulator for multi-turn interaction and evaluate model performance from four perspectives: task utility, ambiguity detection, interaction strategy, and cost efficiency. Experiments on representative LLMs show that ambiguity detection and effective clarification are distinct capabilities, and that repeatedly searching instead of asking for clarification often performs worse than direct guessing, highlighting a critical gap between retrieval ability and interactive problem-solving in current search agents.