Hipótese da Separação Estado-Predição
The State-Prediction Separation Hypothesis
July 1, 2026
Autores: Giovanni Monea, Nathan Godey, Kianté Brantley, Yoav Artzi
cs.AI
Resumo
Os Transformers utilizam o mesmo fluxo de computação direta tanto para prever o próximo token quanto para armazenar estado útil para previsões futuras de tokens. Formulamos a hipótese de separação estado-predição: desvincular os dois papéis resulta em melhor desempenho de modelagem de linguagem. Projetamos uma variante do Transformer que emprega dois fluxos de computação para separar as duas funções, e realizamos experimentos de pré-treinamento em diversas escalas. Nossos experimentos mostram que a separação estado-predição oferece consistentemente melhores eficiências de dados e computação, melhorando a perda de validação e superando os Transformers padrão em média de 2 a 3 pontos percentuais em tarefas downstream. Também conduzimos uma análise empírica abrangente que descarta possíveis confundidores e demonstra a diferença fundamental nos gradientes que nosso projeto acarreta.
English
Transformers use the same forward computation stream to both predict the next token and store useful state for future token predictions. We formulate the state-prediction separation hypothesis: disentangling the two roles yields better language modeling performance. We design a Transformer variant that uses two computation streams to separate the two functions, and conduct pretraining experiments across various scales. Our experiments show that state-prediction separation consistently offers better data and compute efficiencies, improving validation loss and outperforming standard Transformers by 2--3 percentage points on average on downstream tasks. We also conduct extensive empirical analysis that rules out potential confounders and demonstrates the fundamental difference in the gradients our design entails.