Desmistificando o Aumento Durante o Treinamento para o Pré-treinamento de Modelos de Linguagem com Dados Limitados
Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining
June 19, 2026
Autores: Michael K. Chen, Xikun Zhang, Fan Bai, Zhengding Hu, Zhen Wang
cs.AI
Resumo
À medida que os laboratórios de IA se aproximam de um teto de dados onde a capacidade computacional supera a taxa de geração de novos textos de alta qualidade, o pré-treinamento de modelos de linguagem está se movendo em direção a um regime de dados limitados e abundância computacional, que exige um treinamento produtivo de múltiplas épocas em corpora fixos. O pré-treinamento autoregressivo (AR) padrão sofre de overfitting severo neste cenário, atingindo seu ponto ótimo precocemente e depois se deteriorando continuamente. Investigamos a aumento de dados durante o treinamento como um regularizador para mitigar esse overfitting e permitir um treinamento produtivo por centenas de épocas nos mesmos dados. Introduzimos três categorias ortogonais de aumento para pré-treinamento AR: ruído no nível de token (mascaramento, substituição aleatória), permutações de sequência (predição da direita para a esquerda, Preenchimento no Meio) e predição de deslocamento do alvo (x_{t+i} para i > 1). Por meio de ablações sistemáticas, descobrimos que aumentos individuais atrasam o overfitting e reduzem a perda de validação em relação à linha de base, com a substituição aleatória de tokens alcançando a melhor perda mínima entre os métodos individuais. Combinar categorias de aumento reduz ainda mais a perda mínima de validação. Nossos experimentos demonstram que os aumentos de dados mitigam a ineficiência de dados do pré-treinamento AR e oferecem uma solução promissora para o regime de dados limitados~\footnote{Todo o código e dados estão disponíveis em https://github.com/michaelchen-lab/data-augmentations-for-pretraining.}
English
As AI labs approach a data ceiling where compute capacity outpaces the rate of new high-quality text generation, language model pretraining is shifting toward a data-constrained, compute-abundant regime that demands productive multi-epoch training on fixed corpora. Standard autoregressive (AR) pretraining overfits severely in this setting, reaching its optimum early and then continuously deteriorating. We investigate training-time data augmentation as a regularizer to mitigate this overfitting and enable productive training for hundreds of epochs on the same data. We introduce three orthogonal categories of augmentation for AR pretraining: token-level noise (masking, random replacement), sequence permutations (right-to-left prediction, Fill-in-the-Middle), and target offset prediction (x_{t+i} for i > 1). Through systematic ablations, we find that individual augmentations delay overfitting and lower validation loss relative to the baseline, with random token replacement achieving the best minimum loss among individual methods. Combining augmentation categories further lowers the minimum validation loss. Our experiments demonstrate that data augmentations mitigate AR pretraining's data inefficiency and offer a promising solution to the data-constrained regime~\footnote{All code and data are available at https://github.com/ michaelchen-lab/ data-augmentations-for-pretraining.