Les modèles texte-image sont-ils des dindons inductivistes ? Un benchmark contrefactuel pour le raisonnement causal
Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning
June 23, 2026
Auteurs: Jiayi Lei, Yuandong Pu, Xingyu Han, Rongpeng Zhu, Jing Xu, Jinyao Wang, Zijian Zhou, Bin Fu, Yuewen Cao, Yihao Liu, Yongsheng Li
cs.AI
Résumé
Les modèles de génération d'images à partir de texte (T2I) ont réalisé des progrès remarquables pour produire des images visuellement réalistes à partir de consignes en langage naturel. Pourtant, il reste incertain si leur succès reflète une véritable compréhension causale ou un simple appariement sophistiqué de motifs à partir de corrélations visuo-textuelles. Inspirés par la dinde inductiviste de Russell, nous introduisons Counterfactual-World (CF-World), un benchmark contrefactuel conçu pour étudier si les modèles T2I peuvent générer des images selon des règles qui contredisent systématiquement les connaissances a priori du monde réel. CF-World organise chaque scénario en trois niveaux progressifs : génération factuelle reposant sur des connaissances ordinaires du monde, génération contrefactuelle explicite avec instructions visuelles directes, et génération contrefactuelle implicite nécessitant une déduction causale à partir de règles modifiées. Nous évaluons à la fois des modèles T2I open-source et closed-source en utilisant un évaluateur basé sur un modèle de langage visuel (VLM), appelé CF-Eval. De plus, nous introduisons deux métriques : le Taux de Résistance aux A Priori (Prior Resistance Rate, PRR), qui mesure la capacité d'un modèle à surmonter des connaissances a priori bien ancrées du monde réel, et le Taux de Rétention du Raisonnement (Reasoning Retention Rate, RRR), qui évalue si les modèles peuvent maintenir une génération contrefactuelle dépendante du raisonnement sans indices visuels explicites. Les expériences montrent que tous les modèles présentent une dégradation marquée entre les configurations factuelles et contrefactuelles. Des analyses supplémentaires suggèrent que ces échecs proviennent du fait que les modèles T2I actuels encodent les connaissances du monde et les apparences visuelles comme des motifs étroitement couplés. Par conséquent, leur forte dépendance à l'égard des cooccurrences visuelles fréquentes dans les données d'entraînement les force à recourir aux a priori de sens commun familiers lorsqu'ils doivent rendre des mondes contrefactuels.
English
Text-to-image (T2I) generation models have achieved remarkable progress in producing visually realistic images from natural language prompts. Yet it remains unclear whether their success reflects genuine causal understanding or sophisticated pattern matching over visual-textual correlations. Inspired by Russell's inductivist turkey, we introduce Counterfactual-World (CF-World), a counterfactual benchmark designed to investigate whether text-to-image models can generate images under rules that systematically contradict real-world priors. CF-World organizes each scenario into three progressive levels: factual generation under ordinary world knowledge, explicit counterfactual generation with direct visual instructions, and implicit counterfactual generation requiring causal deduction from altered rules. We evaluate both open-source and closed-source T2I models using a Vision Language Model (VLM)-based evaluator (CF-Eval). Furthermore, we introduce two metrics: Prior Resistance Rate (PRR), which measures a model's ability to overcome entrenched real-world priors, and Reasoning Retention Rate (RRR), which assesses whether models can maintain reasoning-dependent counterfactual generation without explicit visual cues. Experiments show that all models exhibit sharp degradation from factual to counterfactual settings. Further analyses suggest that these failures arise because current T2I models encode world knowledge and visual appearances as tightly coupled patterns. Consequently, their heavy reliance on frequent visual co-occurrences within the training data forces them to default to familiar commonsense priors when tasked with rendering counterfactual worlds.