ChatPaper.aiChatPaper

Что LLM-прогнозисты знают, но не говорят: зондирование внутренних представлений для калибровки и верности

What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness

July 9, 2026
Авторы: Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho
cs.AI

Аннотация

Большие языковые модели, дообученные для прогнозирования, могут быть точными, но плохо калиброванными, а их цепочка мыслей (CoT) может не достоверно отражать свидетельства, стоящие за прогнозом. Мы исследуем, являются ли внутренние представления более прямым окном в оба этих аспекта. Работая с Eternis-Forecaster 8B на OpenForesight, мы обучаем зонды, объединяющие представления, на промежуточных активациях и обнаруживаем, что они достигают существенно лучшей калибровки; этот результат также подтверждается для GLM-4.7-Flash и GLM-4.5-Air. Затем мы оцениваем достоверность CoT с помощью абляции доказательств и отвлекающей инъекции: удаление влиятельного источника в промпте часто изменяет прогноз модели, оставляя след рассуждений нетронутым. Те же зонды функционируют как детекторы лжи: их активации отслеживают поведенческие сдвиги гораздо лучше, чем след рассуждений, и они также предсказывают направление изменения в 84% случаев, в том числе когда CoT скрывает влияние возмущения. Наконец, принудительный ответ показывает, что прогнозы в значительной степени фиксируются до начала рассуждений: единичный проход до рассуждений восстанавливает принятый ответ и уверенность, а направление вопросов на основе разброса этого предустановленного распределения ответов экономит 30–47% генерируемых токенов без потери точности. В совокупности эти результаты обосновывают использование зондирования внутренних представлений как практического инструмента для калибровки, аудита и триажа моделей-прогнозистов на основе языковых моделей и, в более широком смысле, моделей рассуждений.
English
Large language models fine-tuned for forecasting can be accurate yet poorly calibrated, and their chain-of-thought (CoT) reasoning may not faithfully reflect the evidence behind a forecast. We ask whether internal representations offer a more direct window into both. Working with Eternis-Forecaster 8B on OpenForesight, we train representation-pooling probes on intermediate activations and find they achieve substantially better calibration; a result that also holds for GLM-4.7-Flash and GLM-4.5-Air. We then assess CoT faithfulness through evidence ablation and diversionary injection: removing an influential source in the prompt often changes the model's forecast while leaving the reasoning trace untouched. The same probes function as lie detectors: their activations track behavioral shifts far better than the reasoning trace does, and they also predict the direction of change in 84% of cases, including when the CoT conceals the perturbation's influence. Finally, forced answering reveals that forecasts are largely fixed before reasoning begins: a single pre-reasoning pass recovers the committed answer and confidence, and routing questions by the spread of this pre-set answer distribution saves 30-47% of generated tokens, with no loss of accuracy. Together, these results establish probing internal representations as a practical tool for calibrating, auditing, and triaging language model forecasters and reasoning models more broadly.