CausalDS: Бенчмаркинг причинно-следственного рассуждения в агентах науки о данных
CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
July 9, 2026
Авторы: Andrej Leban, Yuekai Sun
cs.AI
Аннотация
Большие языковые модели (LLM) всё чаще выступают в роли интегрированных агентов науки о данных, сочетая абстрактное рассуждение с продвинутым использованием инструментов. Однако существующий ландшафт бенчмарков в значительной степени разделяется на бенчмарки символического причинного рассуждения без реалистичного анализа данных и бенчмарки анализа данных без принципиальной причинно-следственной структуры генерации данных. Более того, существующие наборы данных для оценки причинности часто ограничены подобранными примерами из имеющихся источников, а их разнообразие обеспечивается ограниченными шаблонными вариациями, а не систематической генерацией новых синтетических причинных структур. Мы представляем CausalDS — бенчмарк для оценки причинного рассуждения в агентных рабочих процессах науки о данных. Каждый экземпляр бенчмарка представляет собой сцену, состоящую из выборочной структурной причинной модели (SCM) с сгенерированными наблюдательными данными и сопровождающим синтетическим повествованием на естественном языке, основанным на реалистичной предметной области. При необходимости мы обосновываем состав компонентов бенчмарка эмпирическими распределениями, полученными из реальных наборов данных, таким образом сохраняя эмпирическую структуру, но снижая риск «причинного попугайничества» за счёт полностью синтетической генерации. На основе каждой сцены мы затем выводим задачи, охватывающие все три ступени Пирла, причём типичные задачи прогнозирования в науке о данных появляются как Ступень 1. Большинство задач включают компонент программирования в науке о данных, где модели обычно требуется использовать несколько инструментов для получения окончательного ответа из-за частого наличия несовершенных наблюдений, генерируемых моделью наблюдения. Кроме того, распознавание случаев, когда вопрос не допускает обоснованного ответа, и воздержание от ответа рассматривается как первостепенный оцениваемый результат. Таким образом, бенчмарк совместно оценивает символическое причинное рассуждение, науку о данных, количественную оценку неопределённости, воздержание от ответа, а также использование инструментов и программирование.
English
Large language models (LLMs) increasingly act as integrated data-science agents, combining abstract reasoning with advanced tool use. Yet the relevant benchmark landscape largely divides into symbolic causal reasoning benchmarks without realistic data analysis or data analysis benchmarks without a principled causal data-generating structure. Furthermore, existing causal evaluation datasets are often restricted to curated examples from existing sources, with diversity coming from limited templatized variations rather than from systematic generation of novel synthetic causal structures. We introduce CausalDS, a benchmark for evaluating causal reasoning in agentic data-science workflows. Each benchmark instance is a scene consisting of a sampled structural causal model (SCM) with generated observational data and an accompanying synthetic natural-language story grounded in a realistic domain. We optionally ground the composition of the benchmark components in empirical distributions obtained from real-world datasets, thus retaining empirical structure while reducing the "causal parrot" risk through completely synthetic generation. From each scene, we then derive tasks spanning all three of Pearl's rungs, with typical data-science prediction tasks appearing as Rung 1. Most tasks include a data science coding component, where the model typically needs to use several tools to arrive at the final answer due to the frequent presence of imperfect observations, which are generated by an observation model. Additionally, recognizing when a question admits no warranted answer and abstaining is treated as a first-class scored outcome. The benchmark thus jointly evaluates symbolic causal reasoning, data science, uncertainty quantification, abstention, and tool use/coding.