ChatPaper.aiChatPaper

DailyReport: Um Benchmark Aberto para Avaliar Agentes de Busca em Tarefas de Busca Cotidianas

DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks

June 11, 2026
Autores: Jingxuan Han, Wei Liu, Mingyang Zhu, Youpeng Wang, Ziwen Wang, Lin Qiu, Xuezhi Cao, Xunliang Cai, Zheren Fu, Licheng Zhang, Zhendong Mao
cs.AI

Resumo

Agentes de Busca (Search Agents, SAs) tipicamente utilizam grandes modelos de linguagem (large language models, LLMs) para apoiar tarefas complexas de busca de informação, explorando fontes web de forma autónoma e sintetizando informações em respostas abrangentes. Para a avaliação de SAs, benchmarks anteriores focam-se principalmente em tarefas especializadas que dificilmente surgem em cenários reais de utilização. Além disso, a sua dependência de rubricas gerais ao nível da tarefa limita frequentemente a interpretabilidade da avaliação. Para colmatar esta lacuna, apresentamos o DailyReport, um benchmark de resposta aberta para avaliar as capacidades dos SAs em tarefas de pesquisa do quotidiano. Contém 150 tarefas abertas com 3.546 rubricas associadas, capturando necessidades de informação amplamente discutidas e atuais dos utilizadores reais. Cada tarefa é decomposta em sub-tarefas e avaliada com rubricas em cascata em dimensões separadas. Através da atribuição de desempenho em cascata e da agregação centrada no utilizador, obtemos pontuações altamente interpretáveis para cada dimensão, juntamente com uma pontuação de preferência do utilizador. Os nossos resultados em 17 sistemas agentivos mostram que os sistemas atuais ainda ficam aquém das expectativas dos utilizadores. Para facilitar investigação futura, disponibilizamos publicamente o nosso conjunto de dados e código em https://github.com/AGI-Eval-Official/DailyReport.
English
Search Agents (SAs) typically leverage large language models (LLMs) to support complex information-seeking tasks by autonomously exploring web sources and synthesizing information into comprehensive responses. For SAs evaluation, prior benchmarks mainly focus on specialized tasks that are unlikely to arise in real-world user scenarios. Moreover, their reliance on coarse task-level rubrics often limits evaluation interpretability. To bridge this gap, we introduce DailyReport, an open-ended benchmark to evaluate SA capabilities on daily search tasks. It contains 150 open-ended tasks with 3,546 associated rubrics, capturing widely discussed and timely information demands of real-world users. Each task is decomposed into subtasks and evaluated with cascade rubrics across disentangled dimensions. Through cascade performance attribution and user-centric aggregation, we derive highly interpretable scores for each dimension, along with a user preference score. Our results on 17 agentic systems show that current systems still fall short of users' expectations. To facilitate future research, our dataset and code are made publicly available at https://github.com/AGI-Eval-Official/DailyReport.