ChatPaper.aiChatPaper

Leis de Escalonamento Prescritivas para Treinamento com Restrição de Dados

Prescriptive Scaling Laws for Data Constrained Training

May 2, 2026
Autores: Justin Lovelace, Christian Belardi, Srivatsa Kundurthy, Shriya Sudhakar, Kilian Q. Weinberger
cs.AI

Resumo

O poder computacional de treino está a superar cada vez mais a disponibilidade de dados de alta qualidade. Isto desloca o principal desafio da alocação ótima de computação para a extração do máximo valor de dados limitados. A lei de escala de Chinchilla, amplamente adotada, assume que cada token de treino é único. Isto limita a sua capacidade de orientar decisões de pré-treinamento em regimes com restrições de dados. Modelamos a perda excessiva sob repetição com uma penalidade simples de sobreajuste aditiva e verificamos que esta descreve com precisão o comportamento do modelo. A nossa lei de escala produz recomendações qualitativamente novas para alocação computacionalmente ótima. Para além de um certo ponto, a repetição adicional é contraproducente e a computação é melhor aplicada na capacidade do modelo. Demonstramos que seguir a configuração recomendada pela nossa lei melhora o desempenho em regimes com restrições de dados. Finalmente, como a nossa forma de um parâmetro isola o sobreajuste num único coeficiente, permite a comparação direta entre configurações de treino. Como estudo de caso, mostramos que uma forte decaimento de pesos (λ=1.0) reduz este coeficiente em aproximadamente 70%, fornecendo uma explicação baseada em leis de escala para descobertas recentes de que o decaimento de pesos ótimo em regimes com restrições de dados é uma ordem de grandeza superior à prática padrão.
English
Training compute is increasingly outpacing the availability of high-quality data. This shifts the central challenge from optimal compute allocation to extracting maximum value from limited data. The widely adopted Chinchilla scaling law assumes every training token is unique. This limits its ability to guide pretraining decisions in data-constrained regimes. We model the excess loss under repetition with a simple additive overfitting penalty and find that it accurately describes model behavior. Our scaling law yields qualitatively new compute-optimal allocation advice. Beyond a point, further repetition is counterproductive and compute is better spent on model capacity. We show that following our law's recommended configuration improves performance in data-constrained regimes. Finally, because our one-parameter form isolates overfitting in a single coefficient, it enables direct comparison across training configurations. As a case study, we show that strong weight decay (λ=1.0) reduces this coefficient by approximately 70%, providing a scaling-law explanation for recent findings that optimal weight decay in data-constrained regimes is an order of magnitude larger than standard practice.