InfoLaw: Informatieschaalwetten voor Grote Taalmodellen met Kwaliteitsgewogen Gemengde Data en Herhaling
InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition
May 4, 2026
Auteurs: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang
cs.AI
Samenvatting
Het zwaarder wegen van hoogwaardige data in de pre-training van LLM's verbetert vaak de prestaties, maar in data-beperkte regimes, vooral bij overtraining, verhoogt sterker opwaarderen de herhaling en kan het de prestaties verslechteren. Standaard schalingswetten extrapoleren echter niet betrouwbaar over mengselrecepten of onder herhalingen, waardoor de selectie van optimale datarecepten bij schaling onderbepaald is. Om dit op te lossen introduceren we InfoLaw (Information Scaling Laws), een data-bewust schalingskader dat verlies voorspelt op basis van verbruikte tokens, modelgrootte, datamengselgewichten en herhaling. Het kernidee is om pre-training te modelleren als informatieaccumulatie, waarbij kwaliteit de informatiedichtheid regelt en herhaling schaalafhankelijke afnemende meeropbrengsten induceert. We verzamelen eerst de modelprestaties na training op datasets die variëren in schaal, kwaliteitsverdeling en herhalingsniveau. Vervolgens bouwen we de modellering voor informatie op, zodat informatie die modelprestaties nauwkeurig voorspelt. InfoLaw voorspelt prestaties op ongeziene datarecepten en grootschalige runs (tot 7B, 425B tokens) met een gemiddelde en maximale absolute fout van respectievelijk 0,15% en 0,96% in verlies, en het extrapoleert betrouwbaar over overtrainingsniveaus, wat efficiënte selectie van datarecepten onder wisselende rekenbudgetten mogelijk maakt.
English
Upweighting high-quality data in LLM pretraining often improves performance, but in datalimited regimes, especially under overtraining, stronger upweighting increases repetition and can degrade performance. However, standard scaling laws do not reliably extrapolate across mixture recipes or under repetitions, making the selection for optimal data recipes at scaling underdetermined. To solve this, we introduce InfoLaw (Information Scaling Laws), a data-aware scaling framework that predicts loss from consumed tokens, model size, data mixture weights, and repetition. The key idea is to model pretraining as information accumulation, where quality controls information density and repetition induces scaledependent diminishing returns. We first collect the model performance after training on datasets that vary in scale, quality distribution, and repetition level. Then we build up the modeling for information so that information accurately predicts those model performance. InfoLaw predicts performance on unseen data recipes and larger scale runs (up to 7B, 425B tokens) with 0.15% mean and 0.96% max absolute error in loss, and it extrapolates reliably across overtraining levels, enabling efficient data-recipe selection under varying compute budgets.