ChatPaper.aiChatPaper

CausalDS : Évaluation comparative du raisonnement causal dans les agents de science des données

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

July 9, 2026
Auteurs: Andrej Leban, Yuekai Sun
cs.AI

Résumé

Les grands modèles de langage (LLMs) jouent de plus en plus le rôle d’agents intégrés en science des données, combinant raisonnement abstrait et utilisation avancée d’outils. Pourtant, le paysage des benchmarks existants se divise largement entre des benchmarks de raisonnement causal symbolique sans analyse de données réaliste, et des benchmarks d’analyse de données sans structure génératrice de données causale fondée sur des principes. De plus, les ensembles de données d’évaluation causale existants sont souvent limités à des exemples soigneusement sélectionnés provenant de sources existantes, la diversité provenant de variations limitées basées sur des modèles plutôt que d’une génération systématique de nouvelles structures causales synthétiques. Nous présentons CausalDS, un benchmark pour évaluer le raisonnement causal dans les workflows agentiques en science des données. Chaque instance du benchmark est une scène composée d’un modèle causal structurel (SCM) échantillonné avec des données observationnelles générées et une histoire synthétique en langage naturel ancrée dans un domaine réaliste. Nous pouvons optionnellement ancrer la composition des composants du benchmark dans des distributions empiriques obtenues à partir d’ensembles de données réelles, conservant ainsi une structure empirique tout en réduisant le risque de « perroquet causal » grâce à une génération entièrement synthétique. À partir de chaque scène, nous dérivons ensuite des tâches couvrant les trois échelons de Pearl, les tâches typiques de prédiction en science des données apparaissant comme l’échelon 1. La plupart des tâches incluent une composante de codage en science des données, où le modèle doit généralement utiliser plusieurs outils pour arriver à la réponse finale en raison de la présence fréquente d’observations imparfaites, générées par un modèle d’observation. De plus, reconnaître quand une question n’admet pas de réponse justifiée et s’abstenir est traité comme un résultat évalué de première classe. Le benchmark évalue donc conjointement le raisonnement causal symbolique, la science des données, la quantification de l’incertitude, l’abstention, et l’utilisation d’outils/le codage.
English
Large language models (LLMs) increasingly act as integrated data-science agents, combining abstract reasoning with advanced tool use. Yet the relevant benchmark landscape largely divides into symbolic causal reasoning benchmarks without realistic data analysis or data analysis benchmarks without a principled causal data-generating structure. Furthermore, existing causal evaluation datasets are often restricted to curated examples from existing sources, with diversity coming from limited templatized variations rather than from systematic generation of novel synthetic causal structures. We introduce CausalDS, a benchmark for evaluating causal reasoning in agentic data-science workflows. Each benchmark instance is a scene consisting of a sampled structural causal model (SCM) with generated observational data and an accompanying synthetic natural-language story grounded in a realistic domain. We optionally ground the composition of the benchmark components in empirical distributions obtained from real-world datasets, thus retaining empirical structure while reducing the "causal parrot" risk through completely synthetic generation. From each scene, we then derive tasks spanning all three of Pearl's rungs, with typical data-science prediction tasks appearing as Rung 1. Most tasks include a data science coding component, where the model typically needs to use several tools to arrive at the final answer due to the frequent presence of imperfect observations, which are generated by an observation model. Additionally, recognizing when a question admits no warranted answer and abstaining is treated as a first-class scored outcome. The benchmark thus jointly evaluates symbolic causal reasoning, data science, uncertainty quantification, abstention, and tool use/coding.