ChatPaper.aiChatPaper

InfoLaw: Leis de Escala de Informação para Grandes Modelos de Linguagem com Dados de Mistura Ponderados por Qualidade e Repetição

InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition

May 4, 2026
Autores: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang
cs.AI

Resumo

A ponderação superior de dados de alta qualidade no pré-treinamento de LLMs geralmente melhora o desempenho, mas em regimes com dados limitados, especialmente sob sobre-treinamento, uma ponderação mais forte aumenta a repetição e pode degradar o desempenho. No entanto, as leis de escalonamento padrão não extrapolam de forma confiável entre receitas de mistura ou sob repetições, tornando a seleção de receitas de dados ideais no escalonamento subdeterminada. Para resolver isso, introduzimos o InfoLaw (Leis de Escalonamento da Informação), uma estrutura de escalonamento ciente dos dados que prevê a perda a partir de tokens consumidos, tamanho do modelo, pesos da mistura de dados e repetição. A ideia central é modelar o pré-treinamento como acumulação de informação, onde a qualidade controla a densidade da informação e a repetição induz retornos decrescentes dependentes da escala. Primeiro, coletamos o desempenho do modelo após o treinamento em conjuntos de dados que variam em escala, distribuição de qualidade e nível de repetição. Em seguida, construímos a modelagem da informação para que esta preveja com precisão o desempenho do modelo. O InfoLaw prevê o desempenho em receitas de dados não vistas e execuções em escalas maiores (até 7B, 425B tokens) com erro absoluto médio de 0,15% e máximo de 0,96% na perda, e extrapola de forma confiável entre níveis de sobre-treinamento, permitindo a seleção eficiente de receitas de dados sob orçamentos computacionais variáveis.
English
Upweighting high-quality data in LLM pretraining often improves performance, but in datalimited regimes, especially under overtraining, stronger upweighting increases repetition and can degrade performance. However, standard scaling laws do not reliably extrapolate across mixture recipes or under repetitions, making the selection for optimal data recipes at scaling underdetermined. To solve this, we introduce InfoLaw (Information Scaling Laws), a data-aware scaling framework that predicts loss from consumed tokens, model size, data mixture weights, and repetition. The key idea is to model pretraining as information accumulation, where quality controls information density and repetition induces scaledependent diminishing returns. We first collect the model performance after training on datasets that vary in scale, quality distribution, and repetition level. Then we build up the modeling for information so that information accurately predicts those model performance. InfoLaw predicts performance on unseen data recipes and larger scale runs (up to 7B, 425B tokens) with 0.15% mean and 0.96% max absolute error in loss, and it extrapolates reliably across overtraining levels, enabling efficient data-recipe selection under varying compute budgets.