CausalDS: Benchmarken van Causaal Redeneren in Datascience-Agenten
CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
July 9, 2026
Auteurs: Andrej Leban, Yuekai Sun
cs.AI
Samenvatting
Grote taalmodellen (LLM's) functioneren steeds vaker als geïntegreerde data science-agenten, waarbij abstract redeneren wordt gecombineerd met geavanceerd gebruik van hulpmiddelen. Het relevante benchmarklandschap is echter grotendeels opgedeeld in enerzijds symbolische causale redeneerbenchmarks zonder realistische data-analyse en anderzijds data-analysebenchmarks zonder een principiële causale datagenererende structuur. Bovendien zijn bestaande causale evaluatiedatasets vaak beperkt tot zorgvuldig geselecteerde voorbeelden uit bestaande bronnen, waarbij diversiteit voortkomt uit beperkte gesjabloneerde variaties in plaats van uit systematische generatie van nieuwe synthetische causale structuren. Wij introduceren CausalDS, een benchmark voor het evalueren van causaal redeneren in agentische data science-werkstromen. Elk benchmarkexemplaar is een scene bestaande uit een bemonsterd structureel causaal model (SCM) met gegenereerde observationele data en een bijbehorend synthetisch natuurlijk taalverhaal dat is ingebed in een realistisch domein. Optioneel verankeren we de samenstelling van de benchmarkcomponenten in empirische verdelingen verkregen uit real-world datasets, waardoor we de empirische structuur behouden en tegelijkertijd het risico op een 'causale papegaai' verkleinen door volledig synthetische generatie. Uit elke scene leiden we vervolgens taken af die alle drie de treden van Pearl bestrijken, waarbij typische data science-voorspellingstaken als Trede 1 voorkomen. De meeste taken omvatten een data science-codeercomponent, waarbij het model doorgaans meerdere hulpmiddelen moet gebruiken om tot het uiteindelijke antwoord te komen vanwege de frequente aanwezigheid van imperfecte observaties, die worden gegenereerd door een observatiemodel. Bovendien wordt het herkennen wanneer een vraag geen gerechtvaardigd antwoord toelaat, en het zich daarvan onthouden, behandeld als een volwaardig gescoorde uitkomst. De benchmark evalueert dus gezamenlijk symbolisch causaal redeneren, data science, onzekerheidskwantificering, onthouding en toolgebruik/coderen.
English
Large language models (LLMs) increasingly act as integrated data-science agents, combining abstract reasoning with advanced tool use. Yet the relevant benchmark landscape largely divides into symbolic causal reasoning benchmarks without realistic data analysis or data analysis benchmarks without a principled causal data-generating structure. Furthermore, existing causal evaluation datasets are often restricted to curated examples from existing sources, with diversity coming from limited templatized variations rather than from systematic generation of novel synthetic causal structures. We introduce CausalDS, a benchmark for evaluating causal reasoning in agentic data-science workflows. Each benchmark instance is a scene consisting of a sampled structural causal model (SCM) with generated observational data and an accompanying synthetic natural-language story grounded in a realistic domain. We optionally ground the composition of the benchmark components in empirical distributions obtained from real-world datasets, thus retaining empirical structure while reducing the "causal parrot" risk through completely synthetic generation. From each scene, we then derive tasks spanning all three of Pearl's rungs, with typical data-science prediction tasks appearing as Rung 1. Most tasks include a data science coding component, where the model typically needs to use several tools to arrive at the final answer due to the frequent presence of imperfect observations, which are generated by an observation model. Additionally, recognizing when a question admits no warranted answer and abstaining is treated as a first-class scored outcome. The benchmark thus jointly evaluates symbolic causal reasoning, data science, uncertainty quantification, abstention, and tool use/coding.