ChatPaper.aiChatPaper

CausalDS: Evaluación comparativa del razonamiento causal en agentes de ciencia de datos

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

July 9, 2026
Autores: Andrej Leban, Yuekai Sun
cs.AI

Resumen

Los modelos de lenguaje de gran escala (LLMs) actúan cada vez más como agentes integrados de ciencia de datos, combinando razonamiento abstracto con el uso avanzado de herramientas. Sin embargo, el panorama de benchmarks relevante se divide en gran medida entre benchmarks de razonamiento causal simbólico sin análisis de datos realistas y benchmarks de análisis de datos sin una estructura causal generativa de datos basada en principios. Además, los conjuntos de datos de evaluación causal existentes suelen limitarse a ejemplos curados de fuentes ya disponibles, donde la diversidad proviene de variaciones plantillizadas limitadas, en lugar de una generación sistemática de nuevas estructuras causales sintéticas. Presentamos CausalDS, un benchmark para evaluar el razonamiento causal en flujos de trabajo agentivos de ciencia de datos. Cada instancia del benchmark es una escena que consiste en un modelo causal estructural (SCM) muestreado, con datos observacionales generados y una historia sintética en lenguaje natural asociada, fundamentada en un dominio realista. Opcionalmente, fundamentamos la composición de los componentes del benchmark en distribuciones empíricas obtenidas de conjuntos de datos del mundo real, preservando así la estructura empírica y reduciendo el riesgo de "loro causal" mediante una generación completamente sintética. A partir de cada escena, derivamos tareas que abarcan los tres peldaños de Pearl, donde las tareas típicas de predicción en ciencia de datos aparecen como el Peldaño 1. La mayoría de las tareas incluyen un componente de codificación en ciencia de datos, donde el modelo generalmente necesita usar varias herramientas para llegar a la respuesta final debido a la presencia frecuente de observaciones imperfectas, generadas por un modelo de observación. Además, reconocer cuándo una pregunta no admite una respuesta justificada y abstenerse se trata como un resultado puntuado de primera clase. Así, el benchmark evalúa conjuntamente el razonamiento causal simbólico, la ciencia de datos, la cuantificación de incertidumbre, la abstención y el uso de herramientas/codificación.
English
Large language models (LLMs) increasingly act as integrated data-science agents, combining abstract reasoning with advanced tool use. Yet the relevant benchmark landscape largely divides into symbolic causal reasoning benchmarks without realistic data analysis or data analysis benchmarks without a principled causal data-generating structure. Furthermore, existing causal evaluation datasets are often restricted to curated examples from existing sources, with diversity coming from limited templatized variations rather than from systematic generation of novel synthetic causal structures. We introduce CausalDS, a benchmark for evaluating causal reasoning in agentic data-science workflows. Each benchmark instance is a scene consisting of a sampled structural causal model (SCM) with generated observational data and an accompanying synthetic natural-language story grounded in a realistic domain. We optionally ground the composition of the benchmark components in empirical distributions obtained from real-world datasets, thus retaining empirical structure while reducing the "causal parrot" risk through completely synthetic generation. From each scene, we then derive tasks spanning all three of Pearl's rungs, with typical data-science prediction tasks appearing as Rung 1. Most tasks include a data science coding component, where the model typically needs to use several tools to arrive at the final answer due to the frequent presence of imperfect observations, which are generated by an observation model. Additionally, recognizing when a question admits no warranted answer and abstaining is treated as a first-class scored outcome. The benchmark thus jointly evaluates symbolic causal reasoning, data science, uncertainty quantification, abstention, and tool use/coding.