ChatPaper.aiChatPaper

Partition, Prompt, Agrégation : Auto-consistance statistique dans les modèles de langage

Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models

July 16, 2026
Auteurs: Patrik Wolf, Thomas Kleine Buening, Andreas Krause, Celestine Mendler-Dünner
cs.AI

Résumé

L'apprentissage en contexte est généralement interprété comme une forme d'inférence conditionnelle, où la consigne spécifie un contexte et la sortie du modèle est considérée comme une estimation de la distribution conditionnelle correspondante. Si cette interprétation est valide, alors les estimations des LLM devraient satisfaire des identités probabilistes fondamentales. En particulier, la loi de probabilité totale stipule que les distributions conditionnelles pondérées par les a priori s'agrègent en distributions marginales au niveau de la population pour toute partition valide de celle-ci. Dans ce travail, nous examinons dans quelle mesure les estimations des LLM adhèrent à ce principe d'auto-cohérence. Nous utilisons des arbres binaires comme cadre d'évaluation pour partitionner récursivement une population en sous-populations de granularité croissante. Nous sollicitons ensuite les LLM avec des descriptions verbalisées des sous-populations en contexte, nous agrégéons les estimations obtenues en estimations au niveau de la population, et nous les comparons à travers des partitions de granularités variables. En appliquant ce protocole à divers domaines de problèmes et aux modèles de pointe les plus récents, nous mettons en évidence des violations généralisées des propriétés de cohérence de base. Une étude approfondie du *persona prompting* révèle un schéma que nous appelons **l'erreur macro** : les estimations reconstruites à partir des réponses de sous-populations plus fines sont souvent mieux alignées avec les données de référence humaines que les estimations directes au niveau de la population. Cet effet persiste à travers les variations de la structure de l'arbre et de la tâche d'estimation, et peut être partiellement reproduit par des consignes implicites. Ensemble, ces résultats suggèrent que les modèles possèdent des connaissances pertinentes sur les sous-populations mais ne les propagent pas de manière fiable dans les estimations agrégées. Ce fossé établit l'auto-cohérence statistique comme un critère non saturé et sans référence pour évaluer les LLM.
English
In-context learning is commonly interpreted as a form of conditional inference, in which the prompt specifies a context and the model's output is treated as an estimate of the corresponding conditional distribution. If this interpretation holds, then LLM estimates should satisfy basic probabilistic identities. In particular, the law of total probability asserts that prior-weighted conditional distributions aggregate into population-level marginals over any valid partition of the population. In this work, we investigate to what extent LLM estimates adhere to this self-consistency principle. We use binary trees as an evaluation scaffold to recursively partition a population into increasingly fine-grained subpopulations. We then prompt LLMs with verbalized subpopulation descriptions in context, aggregate the resulting estimates back into population-level estimates, and compare them across partitions of varying granularity. Applying this protocol across problem domains and state-of-the-art frontier models, we show widespread violations of basic consistency properties. An in-depth study of persona prompting reveals a pattern we call the macro fallacy: estimates reconstructed from more fine-grained subpopulation responses are often better aligned with human reference data than direct population-level estimates. This effect persists across variations in tree structure and estimation task, and can be partially recovered through implicit prompting. Together, these findings suggest that models possess relevant subpopulation knowledge but do not reliably propagate it into aggregate estimates. This gap establishes statistical self-consistency as an unsaturated, reference-free criterion for evaluating LLMs.