ChatPaper.aiChatPaper

Schaalwetten voor modelsamenvoeging in grote taalmodellen

Model Merging Scaling Laws in Large Language Models

May 11, 2026
Auteurs: Yuanyi Wang, Yanggan Gu, Yiming Zhang, Qi Zhou, Zhaoyi Yan, Congkai Xie, Xinyao Wang, Jianbo Yuan, Hongxia Yang
cs.AI

Samenvatting

We bestuderen empirische schalingswetten voor het samensmelten van taalmodellen, gemeten aan de hand van kruisentropie. Ondanks het brede praktische gebruik, ontbreekt het bij het samensmelten aan een kwantitatieve regel die de opbrengst voorspelt naarmate we experts toevoegen of de modelgrootte opschalen. We identificeren een compacte machtswet die modelgrootte en aantal experts koppelt: de grootte-afhankelijke vloer daalt met de modelcapaciteit, terwijl de samensmeltingsstaart duidelijke afnemende meeropbrengst vertoont in het aantal experts. De wet geldt binnen het domein en over domeinen heen, sluit nauw aan bij gemeten curven over diverse architecturen en methoden (Average, TA, TIES, DARE), en verklaart twee robuuste regelmatigheden: de meeste winst komt vroeg, en de variabiliteit neemt af naarmate meer experts worden opgenomen. Voortbouwend hierop presenteren we een eenvoudige theorie die verklaart waarom de winst ruwweg als 1/k daalt, en die de vloer en staart koppelt aan eigenschappen van het basismodel en de diversiteit over domeinen heen. Deze wet maakt voorspellende planning mogelijk: schat hoeveel experts nodig zijn om een doelverlies te bereiken, beslis wanneer te stoppen met het toevoegen van experts, en maak een afweging tussen het opschalen van het basismodel en het toevoegen van experts onder een vast budget – waardoor het samensmelten van een heuristische praktijk verandert in een computationeel efficiënt, planbaar alternatief voor multitask-training. Dit suggereert een schalingsprincipe voor gedistribueerde generatieve AI: voorspelbare winst kan worden bereikt door specialisten te combineren, wat een complementair pad biedt naar systemen op AGI-niveau.
English
We study empirical scaling laws for language model merging measured by cross-entropy. Despite its wide practical use, merging lacks a quantitative rule that predicts returns as we add experts or scale the model size. We identify a compact power law that links model size and expert number: the size-dependent floor decreases with model capacity, while the merging tail exhibits clear diminishing returns in the number of experts. The law holds in-domain and cross-domain, tightly fits measured curves across diverse architectures and methods (Average, TA, TIES, DARE), and explains two robust regularities: most gains arrive early, and variability shrinks as more experts are included. Building on this, we present a simple theory that explains why gains fall roughly as 1/k and links the floor and tail to properties of the base model and the diversity across domains. This law enables predictive planning: estimate how many experts are needed to reach a target loss, decide when to stop adding experts, and trade off scaling the base model versus adding experts under a fixed budget--turning merging from heuristic practice into a computationally efficient, planable alternative to multitask training. This suggests a scaling principle for distributed generative AI: predictable gains can be achieved by composing specialists, offering a complementary path toward AGI-level systems.