Ce que les prédicteurs LLM savent mais ne disent pas : sonder les représentations internes pour l'étalonnage et la fidélité
What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
July 9, 2026
Auteurs: Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho
cs.AI
Résumé
Les grands modèles de langage affinés pour la prévision peuvent être précis mais mal calibrés, et leur raisonnement par chaîne de pensée (CoT) peut ne pas refléter fidèlement les preuves sous-jacentes à une prévision. Nous nous demandons si les représentations internes offrent une fenêtre plus directe sur ces deux aspects. En travaillant avec Eternis-Forecaster 8B sur OpenForesight, nous entraînons des sondes de pooling de représentations sur les activations intermédiaires et constatons qu'elles atteignent une calibration nettement meilleure — un résultat qui se vérifie également pour GLM-4.7-Flash et GLM-4.5-Air. Nous évaluons ensuite la fidélité du CoT par ablation des preuves et injection de diversion : la suppression d'une source influente dans l'invite modifie souvent la prévision du modèle sans toucher au tracé du raisonnement. Les mêmes sondes fonctionnent comme des détecteurs de mensonge : leurs activations suivent les changements comportementaux bien mieux que le tracé du raisonnement, et elles prédisent également la direction du changement dans 84 % des cas, y compris lorsque le CoT dissimule l'influence de la perturbation. Enfin, la réponse forcée révèle que les prévisions sont largement fixées avant même que le raisonnement ne commence : un unique passage pré-raisonnement retrouve la réponse et la confiance engagées, et l'acheminement des questions selon la dispersion de cette distribution de réponses préétablie permet d'économiser 30 à 47 % des jetons générés, sans perte de précision. Ensemble, ces résultats établissent l'interrogation des représentations internes comme un outil pratique pour calibrer, auditer et trier les modèles de langage prévisionnels et les modèles de raisonnement plus largement.
English
Large language models fine-tuned for forecasting can be accurate yet poorly calibrated, and their chain-of-thought (CoT) reasoning may not faithfully reflect the evidence behind a forecast. We ask whether internal representations offer a more direct window into both. Working with Eternis-Forecaster 8B on OpenForesight, we train representation-pooling probes on intermediate activations and find they achieve substantially better calibration; a result that also holds for GLM-4.7-Flash and GLM-4.5-Air. We then assess CoT faithfulness through evidence ablation and diversionary injection: removing an influential source in the prompt often changes the model's forecast while leaving the reasoning trace untouched. The same probes function as lie detectors: their activations track behavioral shifts far better than the reasoning trace does, and they also predict the direction of change in 84% of cases, including when the CoT conceals the perturbation's influence. Finally, forced answering reveals that forecasts are largely fixed before reasoning begins: a single pre-reasoning pass recovers the committed answer and confidence, and routing questions by the spread of this pre-set answer distribution saves 30-47% of generated tokens, with no loss of accuracy. Together, these results establish probing internal representations as a practical tool for calibrating, auditing, and triaging language model forecasters and reasoning models more broadly.