ChatPaper.aiChatPaper

AgenticDataBench: Um Benchmark Abrangente para Agentes de Dados

AgenticDataBench: A Comprehensive Benchmark for Data Agents

July 2, 2026
Autores: Zhaoyan Sun, Shan Zhong, Daizhou Wen, Jiaxing Han, Guoliang Li, Ying Yan, Peng Zhang, Yu Su, Xiang Qi, Baolin Sun, Chengyuan Yang, Tao Fang, Huaiyu Ruan
cs.AI

Resumo

A ciência de dados tem como objetivo extrair insights acionáveis de dados brutos heterogêneos, desbloqueando o valor das enormes quantidades de dados gerados na sociedade moderna. Automatizar esse processo é essencial para reduzir os esforços intensivos em mão de obra dos cientistas de dados e viabilizar aplicações escaláveis baseadas em dados. Recentemente, agentes de dados baseados em modelos de linguagem de grande escala (LLMs) surgiram como uma solução promissora para automatizar fluxos de trabalho de ciência de dados. No entanto, a área carece de benchmarks abrangentes para avaliar rigorosamente esses agentes em diversos cenários com granularidade refinada. Para preencher essa lacuna, propomos o AgenticDataBench, um benchmark abrangente que apresenta tarefas realistas em diversos domínios com rótulos de referência de granularidade fina. Isso possibilita avaliações que capturam a diversidade e complexidade dos fluxos de trabalho de ciência de dados, bem como o desempenho detalhado dos agentes. Primeiro, para cobrir diversos domínios, coletamos conjuntos de dados e tarefas reais de 15 domínios verticais, incluindo 5 casos de uso B2B reais de uma empresa líder em fintech. Segundo, para remover redundâncias em tarefas do mundo real e gerar tarefas de alta qualidade para domínios que carecem de dados reais, introduzimos habilidades de ciência de dados, padrões operacionais recorrentes centrados em dados, e quantificamos a cobertura do benchmark pelo número de habilidades incluídas. Habilidades representativas são extraídas de soluções de tarefas em grande escala no Stack Overflow por meio de agrupamento hierárquico alinhado por habilidades. Terceiro, para tarefas de negócios reais, selecionamos pares tarefa-solução que maximizam a diversidade na composição de habilidades, garantindo ampla cobertura de cenários práticos. Quarto, para gerar tarefas realistas para domínios concebidos sem tarefas reais, propomos uma abordagem sistemática de geração de tarefas baseada em LLM para criar fluxos de trabalho e tarefas com base nessas habilidades. Por fim, avaliamos agentes de dados de última geração usando nosso benchmark anotado e ambiente de teste de código aberto, fornecendo insights detalhados em nível de habilidade.
English
Data science aims to derive actionable insights from heterogeneous raw data, unlocking the value of the massive amounts of data generated in modern society. Automating this process is essential to reducing labor-intensive efforts for data scientists and enabling scalable data-driven applications. Recently, large language model (LLM)-based data agents have emerged as a promising solution to automate data science workflows. However, the field lacks comprehensive benchmarks to rigorously evaluate these agents across diverse scenarios with fine-grained granularity. To address this gap, we propose AgenticDataBench, a comprehensive benchmark featuring realistic tasks spanning diverse domains with fine-grained ground-truth labels. This enables evaluations to capture the diversity and complexity of data science workflows and the detailed performance of agents. First, to cover diverse domains, we collect real datasets and tasks from 15 vertical domains, including 5 real-world B2B use cases from a leading fintech company. Second, to remove redundancy in real-world tasks and generate high-quality tasks for domains lacking real data, we introduce data science skills, recurring data-centric operational patterns, and quantify benchmark coverage by the number of skills included. Representative skills are extracted from large-scale task solutions on Stack Overflow using skill-aligned hierarchical clustering. Third, for real-world business tasks, we select task-solution pairs that maximize diversity in skill composition, ensuring broad coverage of practical scenarios. Fourth, to generate realistic tasks for devise domains without real tasks, we propose a systematic LLM-based task generation approach to create workflows and tasks based on these skills. Finally, we evaluate state-of-the-art data agents using our annotated benchmark and open-sourced testbed, providing detailed skill-level insights.