Predição de Comportamento Futuro como Tarefa de Aprendizagem
Forecasting Future Behavior as a Learning Task
June 9, 2026
Autores: Mosh Levy, Yoav Goldberg, Asa Cooper Stickland
cs.AI
Resumo
A confiança em um sistema de IA é frequentemente ancorada por explicações de como ele funciona, que são então usadas para prever seu comportamento em novas entradas. Para modelos de raciocínio de grande porte (LRMs), essa via convencional é particularmente difícil de seguir: métodos de explicação para gerações de tokens individuais não se generalizam naturalmente para trajetórias longas, e as próprias trajetórias frequentemente não são fiéis quando lidas como linguagem natural. Propomos uma alternativa que contorna a etapa de explicação: tratar a previsão de comportamento como uma tarefa aprendível e treinar Preditores de Comportamento que operam sobre uma única trajetória de raciocínio para fazer as mesmas previsões que normalmente se buscaria a partir de uma explicação. Os dados de treinamento do preditor são obtidos consultando o LRM sem anotação humana, e sua inferência é realizada em uma única passagem direta. Instanciamos essa abordagem em duas tarefas: qual a probabilidade de o LRM repetir sua resposta em novas execuções, e como remover partes da entrada altera sua resposta. Avaliamos essa abordagem em ambas as tarefas em três conjuntos de dados de raciocínio diversos e descobrimos que Preditores de Comportamento treinados são mais precisos do que o GPT-5.4 e o Claude Opus-4.6 lendo as mesmas trajetórias como leitores ingênuos, a uma pequena fração de seu custo de inferência. Constatamos que o ajuste fino da espinha dorsal (backbone) de ponta a ponta e sua inicialização a partir do LRM alvo são ambos necessários para um desempenho robusto. Esses resultados mostram que a trajetória de raciocínio carrega informações sobre o comportamento futuro do LRM que vão além do que a leitura ingênua transmite.
English
Trust in an AI system is often anchored by explanations of how it works, which one then uses to forecast its behavior on new inputs. For large reasoning models (LRMs), this conventional route is particularly difficult to follow: explanation methods for single token generations do not naturally generalize to long trajectories, and the trajectories themselves are often not faithful when read as natural language. We propose an alternative that bypasses the explanation step: treat behavior forecasting as a learnable task and train Behavior Forecasters that operates on a single reasoning trajectory to make the same forecasts one would typically seek from an explanation. The forecaster's training data is obtained by querying the LRM with no human annotation, and its inference is done in a single forward pass. We instantiate this approach on two tasks: how likely the LRM is to repeat its answer on re-runs, and how removing parts of the input changes its answer. We evaluate this approach on both tasks across three diverse reasoning datasets and find that trained Behavior Forecasters are more accurate than GPT-5.4 and Claude Opus-4.6 reading the same trajectories as naive readers, at a small fraction of their inference cost. We find that fine-tuning the backbone end-to-end and initializing it from the target LRM are each necessary for strong performance. These results show that the reasoning trajectory carries information about the LRM's future behavior that goes beyond what naive reading conveys.