ChatPaper.aiChatPaper

LoiInfo : Lois d'échelle de l'information pour les grands modèles de langage avec des données mixtes pondérées par la qualité et répétition

InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition

May 4, 2026
Auteurs: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang
cs.AI

Résumé

La pondération accrue des données de haute qualité lors du pré-entraînement des modèles linguistiques (LLM) améliore souvent les performances, mais dans des régimes de données limitées, surtout en cas de surentraînement, une pondération plus forte augmente les répétitions et peut dégrader les résultats. Cependant, les lois d'échelle classiques ne permettent pas d'extrapoler de manière fiable entre différentes recettes de mélange ou en présence de répétitions, rendant la sélection des recettes de données optimales pour la mise à l'échelle indéterminée. Pour résoudre ce problème, nous introduisons InfoLaw (Lois d'Échelle Informationnelles), un cadre d'échelle prenant en compte les données, qui prédit la perte à partir des tokens consommés, de la taille du modèle, des poids de mélange des données et des répétitions. L'idée clé est de modéliser le pré-entraînement comme une accumulation d'information, où la qualité contrôle la densité informationnelle et les répétitions induisent des rendements décroissants dépendants de l'échelle. Nous commençons par recueillir les performances du modèle après entraînement sur des jeux de données variant en taille, distribution de qualité et niveau de répétition. Ensuite, nous construisons un modèle informationnel permettant de prédire précisément ces performances. InfoLaw prédit les performances pour des recettes de données inédites et des exécutions à plus grande échelle (jusqu'à 7B, 425B tokens) avec une erreur absolue moyenne de 0,15 % et maximale de 0,96 % sur la perte, et extrapole de manière fiable à travers différents niveaux de surentraînement, permettant une sélection efficace des recettes de données pour divers budgets de calcul.
English
Upweighting high-quality data in LLM pretraining often improves performance, but in datalimited regimes, especially under overtraining, stronger upweighting increases repetition and can degrade performance. However, standard scaling laws do not reliably extrapolate across mixture recipes or under repetitions, making the selection for optimal data recipes at scaling underdetermined. To solve this, we introduce InfoLaw (Information Scaling Laws), a data-aware scaling framework that predicts loss from consumed tokens, model size, data mixture weights, and repetition. The key idea is to model pretraining as information accumulation, where quality controls information density and repetition induces scaledependent diminishing returns. We first collect the model performance after training on datasets that vary in scale, quality distribution, and repetition level. Then we build up the modeling for information so that information accurately predicts those model performance. InfoLaw predicts performance on unseen data recipes and larger scale runs (up to 7B, 425B tokens) with 0.15% mean and 0.96% max absolute error in loss, and it extrapolates reliably across overtraining levels, enabling efficient data-recipe selection under varying compute budgets.