ChatPaper.aiChatPaper

O que os previsores de LLM sabem mas não dizem: Sondando representações internas para calibração e fidelidade

What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness

July 9, 2026
Autores: Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho
cs.AI

Resumo

Modelos de linguagem de grande escala ajustados para previsão podem ser precisos, mas mal calibrados, e seu raciocínio em cadeia de pensamento (CoT) pode não refletir fielmente as evidências por trás de uma previsão. Perguntamos se as representações internas oferecem uma janela mais direta para ambos. Trabalhando com o Eternis-Forecaster 8B no OpenForesight, treinamos sondas de pooling de representações em ativações intermediárias e descobrimos que elas alcançam uma calibração substancialmente melhor; um resultado que também se aplica ao GLM-4.7-Flash e ao GLM-4.5-Air. Em seguida, avaliamos a fidelidade do CoT por meio de ablação de evidências e injeção diversionária: remover uma fonte influente no prompt frequentemente altera a previsão do modelo enquanto deixa o traço de raciocínio intacto. As mesmas sondas funcionam como detectores de mentiras: suas ativações acompanham as mudanças comportamentais muito melhor do que o traço de raciocínio, e também preveem a direção da mudança em 84% dos casos, inclusive quando o CoT oculta a influência da perturbação. Finalmente, a resposta forçada revela que as previsões são amplamente fixadas antes do início do raciocínio: uma única passagem pré-raciocínio recupera a resposta comprometida e a confiança, e encaminhar perguntas pela dispersão dessa distribuição de respostas predefinida economiza 30-47% dos tokens gerados, sem perda de precisão. Juntos, esses resultados estabelecem a sondagem de representações internas como uma ferramenta prática para calibrar, auditar e triar modelos de linguagem preditivos e modelos de raciocínio de forma mais ampla.
English
Large language models fine-tuned for forecasting can be accurate yet poorly calibrated, and their chain-of-thought (CoT) reasoning may not faithfully reflect the evidence behind a forecast. We ask whether internal representations offer a more direct window into both. Working with Eternis-Forecaster 8B on OpenForesight, we train representation-pooling probes on intermediate activations and find they achieve substantially better calibration; a result that also holds for GLM-4.7-Flash and GLM-4.5-Air. We then assess CoT faithfulness through evidence ablation and diversionary injection: removing an influential source in the prompt often changes the model's forecast while leaving the reasoning trace untouched. The same probes function as lie detectors: their activations track behavioral shifts far better than the reasoning trace does, and they also predict the direction of change in 84% of cases, including when the CoT conceals the perturbation's influence. Finally, forced answering reveals that forecasts are largely fixed before reasoning begins: a single pre-reasoning pass recovers the committed answer and confidence, and routing questions by the spread of this pre-set answer distribution saves 30-47% of generated tokens, with no loss of accuracy. Together, these results establish probing internal representations as a practical tool for calibrating, auditing, and triaging language model forecasters and reasoning models more broadly.