Formalisering van latente gedachten: vier axioma's van gedachtenrepresentatie in LLM's
Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs
May 7, 2026
Auteurs: Fahd Seddik, Fatemeh Fard
cs.AI
Samenvatting
Wij introduceren een axiomatisch evaluatiekader voor latente gedachterepresentaties in LLM's, bestaande uit metrieken die onafhankelijk zijn van downstream-benchmarkscores en representatiefouten onthullen die door benchmarknauwkeurigheid worden gemaskeerd. Bestaande evaluaties verwarren representatiekwaliteit met modelcapaciteit. Daarom kunnen fouten niet worden toegeschreven aan de representatie in plaats van aan het model dat deze verwerkt. Wij formaliseren vier functionele axioma's (Causaliteit, Minimaliteit, Scheidbaarheid en Stabiliteit) en definiëren voor elk een kwantitatieve maat, direct berekend op de representatie, onafhankelijk van downstream-nauwkeurigheid. Wij auditen opengewicht-LLM's over 23 redeneertaken (bijv. Ruimtelijk Redeneren, Feitelijke QA). Wij constateren dat geen enkele kandidaat alle vier de axioma's tegelijkertijd vervult, dat de representaties het taaktype betrouwbaar onderscheiden maar geen onderscheid kunnen maken tussen twee vragen binnen dezelfde taak, en dat de representaties weinig informatie coderen boven wat al aanwezig is in de invoer-embedding. Het falen is consistent over dichte, via redeneringsdestillatie getrainde en met RL getrainde modelfamilies, wat aangeeft dat de kloof structureel is en geen eigenschap van modelgrootte of trainingsprocedure.
English
We introduce an axiomatic evaluation framework for latent thought representations in LLMs, comprising metrics that are independent of downstream benchmark scores and reveal representational failures that benchmark accuracy masks. Existing evaluations conflate representation quality with model capacity. Therefore, failures cannot be attributed to the representation rather than to the model that processes it. We formalize four functional axioms (Causality, Minimality, Separability, and Stability) and define a quantitative measure for each, computed directly on the representation independently of downstream accuracy. We audit open-weight LLMs across 23 reasoning tasks (e.g., Spatial Reasoning, Factual QA). We find that no candidate satisfies all four axioms simultaneously, that the representations distinguish task type reliably but cannot distinguish between two questions within the same task, and that the representations encode little information beyond what is already present in the input embedding. The failure is consistent across dense, reasoning-distilled, and RL-trained model families, indicating that the gap is structural rather than a property of model size or training procedure.