AgenticDataBench: Een uitgebreide benchmark voor data-agenten
AgenticDataBench: A Comprehensive Benchmark for Data Agents
July 2, 2026
Auteurs: Zhaoyan Sun, Shan Zhong, Daizhou Wen, Jiaxing Han, Guoliang Li, Ying Yan, Peng Zhang, Yu Su, Xiang Qi, Baolin Sun, Chengyuan Yang, Tao Fang, Huaiyu Ruan
cs.AI
Samenvatting
Datascience heeft als doel om bruikbare inzichten te verkrijgen uit heterogene ruwe data, waardoor de waarde van de enorme hoeveelheden data die in de moderne samenleving worden gegenereerd, wordt ontsloten. Het automatiseren van dit proces is essentieel om de arbeidsintensieve inspanningen van datascientists te verminderen en schaalbare datagedreven toepassingen mogelijk te maken. Recentelijk zijn op grote taalmodellen (LLM's) gebaseerde data-agenten naar voren gekomen als een veelbelovende oplossing om datascience-workflows te automatiseren. Het vakgebied mist echter uitgebreide benchmarks om deze agenten rigoureus te evalueren in uiteenlopende scenario's met een fijnmazige granulariteit. Om deze lacune aan te pakken, stellen wij AgenticDataBench voor, een uitgebreide benchmark met realistische taken uit diverse domeinen, voorzien van fijnmazige grondwaarheidslabels. Dit maakt evaluaties mogelijk die de diversiteit en complexiteit van datascience-workflows en de gedetailleerde prestaties van agenten in kaart brengen. Ten eerste verzamelen we, om diverse domeinen te bestrijken, echte datasets en taken uit 15 verticale domeinen, waaronder 5 realistische B2B-use cases van een toonaangevend fintechbedrijf. Ten tweede introduceren we, om redundantie in realistische taken te verwijderen en hoogwaardige taken te genereren voor domeinen die geen echte data hebben, datascience-vaardigheden, terugkerende datacentrische operationele patronen, en kwantificeren we de dekkingsgraad van de benchmark aan de hand van het aantal opgenomen vaardigheden. Representatieve vaardigheden worden geëxtraheerd uit grootschalige taakoplossingen op Stack Overflow met behulp van vaardigheid-afgestemde hiërarchische clustering. Ten derde selecteren we voor realistische zakelijke taken taak-oplossingparen die de diversiteit in vaardigheidssamenstelling maximaliseren, wat een brede dekking van praktische scenario's waarborgt. Ten vierde stellen we, om realistische taken te genereren voor domeinen zonder echte taken, een systematische, op LLM's gebaseerde taakgeneratiebenadering voor om workflows en taken te creëren op basis van deze vaardigheden. Tot slot evalueren we state-of-the-art data-agenten met behulp van onze geannoteerde benchmark en open-source testomgeving, wat gedetailleerde inzichten op vaardigheidsniveau oplevert.
English
Data science aims to derive actionable insights from heterogeneous raw data, unlocking the value of the massive amounts of data generated in modern society. Automating this process is essential to reducing labor-intensive efforts for data scientists and enabling scalable data-driven applications. Recently, large language model (LLM)-based data agents have emerged as a promising solution to automate data science workflows. However, the field lacks comprehensive benchmarks to rigorously evaluate these agents across diverse scenarios with fine-grained granularity. To address this gap, we propose AgenticDataBench, a comprehensive benchmark featuring realistic tasks spanning diverse domains with fine-grained ground-truth labels. This enables evaluations to capture the diversity and complexity of data science workflows and the detailed performance of agents. First, to cover diverse domains, we collect real datasets and tasks from 15 vertical domains, including 5 real-world B2B use cases from a leading fintech company. Second, to remove redundancy in real-world tasks and generate high-quality tasks for domains lacking real data, we introduce data science skills, recurring data-centric operational patterns, and quantify benchmark coverage by the number of skills included. Representative skills are extracted from large-scale task solutions on Stack Overflow using skill-aligned hierarchical clustering. Third, for real-world business tasks, we select task-solution pairs that maximize diversity in skill composition, ensuring broad coverage of practical scenarios. Fourth, to generate realistic tasks for devise domains without real tasks, we propose a systematic LLM-based task generation approach to create workflows and tasks based on these skills. Finally, we evaluate state-of-the-art data agents using our annotated benchmark and open-sourced testbed, providing detailed skill-level insights.