Was LLM-Prognostiker wissen, aber nicht sagen: Sondierung interner Repräsentationen für Kalibrierung und Treue
What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
July 9, 2026
Autoren: Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho
cs.AI
Zusammenfassung
Große, für die Vorhersage feinabgestimmte Sprachmodelle können zwar genaue, aber schlecht kalibrierte Ergebnisse liefern, und ihre Chain-of-Thought (CoT)-Argumentation spiegelt möglicherweise nicht getreu die einer Vorhersage zugrundeliegende Evidenz wider. Wir untersuchen, ob interne Repräsentationen einen direkteren Zugang zu beiden Aspekten bieten. Unter Verwendung von Eternis-Forecaster 8B auf OpenForesight trainieren wir Repräsentations-Pooling-Sonden auf Zwischenaktivierungen und stellen fest, dass diese eine wesentlich bessere Kalibrierung erreichen – ein Ergebnis, das auch für GLM-4.7-Flash und GLM-4.5-Air gilt. Anschließend bewerten wir die Treue der CoT durch Evidenz-Ablation und Ablenkungsinjektion: Das Entfernen einer einflussreichen Quelle im Prompt ändert oft die Vorhersage des Modells, während die Argumentationsspur unberührt bleibt. Dieselben Sonden fungieren als Lügendetektoren: Ihre Aktivierungen erfassen Verhaltensänderungen weit besser als die Argumentationsspur, und sie sagen zudem in 84 % der Fälle die Richtung der Änderung voraus – auch dann, wenn die CoT den Einfluss der Störung verschleiert. Schließlich zeigt erzwungenes Antworten, dass Vorhersagen weitgehend festgelegt sind, bevor die Argumentation beginnt: Ein einziger Vor-Argumentations-Durchlauf stellt die festgelegte Antwort und das Konfidenzniveau wieder her, und das Weiterleiten von Fragen anhand der Streuung dieser vorab festgelegten Antwortverteilung spart 30–47 % der generierten Token, ohne Genauigkeitsverlust. Insgesamt etablieren diese Ergebnisse das Sondieren interner Repräsentationen als praktisches Werkzeug zur Kalibrierung, Überprüfung und Triage von Sprachmodell-Vorhersagemodellen und allgemeiner von Argumentationsmodellen.
English
Large language models fine-tuned for forecasting can be accurate yet poorly calibrated, and their chain-of-thought (CoT) reasoning may not faithfully reflect the evidence behind a forecast. We ask whether internal representations offer a more direct window into both. Working with Eternis-Forecaster 8B on OpenForesight, we train representation-pooling probes on intermediate activations and find they achieve substantially better calibration; a result that also holds for GLM-4.7-Flash and GLM-4.5-Air. We then assess CoT faithfulness through evidence ablation and diversionary injection: removing an influential source in the prompt often changes the model's forecast while leaving the reasoning trace untouched. The same probes function as lie detectors: their activations track behavioral shifts far better than the reasoning trace does, and they also predict the direction of change in 84% of cases, including when the CoT conceals the perturbation's influence. Finally, forced answering reveals that forecasts are largely fixed before reasoning begins: a single pre-reasoning pass recovers the committed answer and confidence, and routing questions by the spread of this pre-set answer distribution saves 30-47% of generated tokens, with no loss of accuracy. Together, these results establish probing internal representations as a practical tool for calibrating, auditing, and triaging language model forecasters and reasoning models more broadly.