Lo que los pronosticadores de LLM saben pero no dicen: Sondeo de representaciones internas para la calibración y la fidelidad
What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
July 9, 2026
Autores: Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho
cs.AI
Resumen
Los modelos de lenguaje de gran escala ajustados finamente para realizar pronósticos pueden ser precisos pero estar mal calibrados, y su razonamiento en cadena de pensamiento (CoT) podría no reflejar fielmente la evidencia subyacente a una predicción. Nos preguntamos si las representaciones internas ofrecen una ventana más directa hacia ambos aspectos. Trabajando con Eternis-Forecaster 8B en OpenForesight, entrenamos sondas de agrupación de representaciones sobre activaciones intermedias y descubrimos que logran una calibración sustancialmente mejor; resultado que también se sostiene para GLM-4.7-Flash y GLM-4.5-Air. Luego evaluamos la fidelidad del CoT mediante ablación de evidencia e inyección desviadora: eliminar una fuente influyente en la instrucción a menudo cambia el pronóstico del modelo sin alterar el rastro de razonamiento. Las mismas sondas funcionan como detectores de mentiras: sus activaciones rastrean los cambios conductuales mucho mejor que el rastro de razonamiento, y además predicen la dirección del cambio en el 84% de los casos, incluso cuando el CoT oculta la influencia de la perturbación. Finalmente, la respuesta forzada revela que los pronósticos quedan en gran medida fijados antes de que comience el razonamiento: una única pasada previa al razonamiento recupera la respuesta comprometida y la confianza, y enrutar las preguntas según la dispersión de esta distribución de respuestas preestablecida ahorra entre un 30% y un 47% de los tokens generados, sin pérdida de precisión. En conjunto, estos resultados establecen la exploración de representaciones internas como una herramienta práctica para calibrar, auditar y realizar triaje de modelos de lenguaje pronosticadores y, de forma más amplia, de modelos de razonamiento.
English
Large language models fine-tuned for forecasting can be accurate yet poorly calibrated, and their chain-of-thought (CoT) reasoning may not faithfully reflect the evidence behind a forecast. We ask whether internal representations offer a more direct window into both. Working with Eternis-Forecaster 8B on OpenForesight, we train representation-pooling probes on intermediate activations and find they achieve substantially better calibration; a result that also holds for GLM-4.7-Flash and GLM-4.5-Air. We then assess CoT faithfulness through evidence ablation and diversionary injection: removing an influential source in the prompt often changes the model's forecast while leaving the reasoning trace untouched. The same probes function as lie detectors: their activations track behavioral shifts far better than the reasoning trace does, and they also predict the direction of change in 84% of cases, including when the CoT conceals the perturbation's influence. Finally, forced answering reveals that forecasts are largely fixed before reasoning begins: a single pre-reasoning pass recovers the committed answer and confidence, and routing questions by the spread of this pre-set answer distribution saves 30-47% of generated tokens, with no loss of accuracy. Together, these results establish probing internal representations as a practical tool for calibrating, auditing, and triaging language model forecasters and reasoning models more broadly.