Lois d'échelle de la fusion de modèles dans les grands modèles de langage
Model Merging Scaling Laws in Large Language Models
May 11, 2026
Auteurs: Yuanyi Wang, Yanggan Gu, Yiming Zhang, Qi Zhou, Zhaoyi Yan, Congkai Xie, Xinyao Wang, Jianbo Yuan, Hongxia Yang
cs.AI
Résumé
Nous étudions les lois d'échelle empiriques pour la fusion de modèles de langage mesurée par l'entropie croisée. Malgré son usage pratique répandu, la fusion manque d'une règle quantitative prédisant les gains à mesure que l'on ajoute des experts ou que l'on augmente la taille du modèle. Nous identifions une loi de puissance compacte reliant la taille du modèle et le nombre d'experts : le plancher dépendant de la taille diminue avec la capacité du modèle, tandis que la queue de la fusion présente des rendements décroissants nets en fonction du nombre d'experts. La loi se vérifie intra-domaine et inter-domaines, s'ajuste étroitement aux courbes mesurées pour diverses architectures et méthodes (Average, TA, TIES, DARE), et explique deux régularités robustes : la majorité des gains surviennent tôt, et la variabilité diminue à mesure que l'on inclut davantage d'experts. À partir de là, nous présentons une théorie simple qui explique pourquoi les gains décroissent approximativement en 1/k et relie le plancher et la queue aux propriétés du modèle de base et à la diversité entre les domaines. Cette loi permet une planification prédictive : estimer combien d'experts sont nécessaires pour atteindre une perte cible, décider quand cesser d'ajouter des experts, et arbitrer entre l'augmentation de la taille du modèle de base et l'ajout d'experts sous un budget fixe—transformant ainsi la fusion d'une pratique heuristique en une alternative efficace sur le plan computationnel et planifiable à l'entraînement multitâche. Cela suggère un principe d'échelle pour l'IA générative distribuée : des gains prévisibles peuvent être obtenus en composant des spécialistes, offrant une voie complémentaire vers des systèmes de niveau IAG.
English
We study empirical scaling laws for language model merging measured by cross-entropy. Despite its wide practical use, merging lacks a quantitative rule that predicts returns as we add experts or scale the model size. We identify a compact power law that links model size and expert number: the size-dependent floor decreases with model capacity, while the merging tail exhibits clear diminishing returns in the number of experts. The law holds in-domain and cross-domain, tightly fits measured curves across diverse architectures and methods (Average, TA, TIES, DARE), and explains two robust regularities: most gains arrive early, and variability shrinks as more experts are included. Building on this, we present a simple theory that explains why gains fall roughly as 1/k and links the floor and tail to properties of the base model and the diversity across domains. This law enables predictive planning: estimate how many experts are needed to reach a target loss, decide when to stop adding experts, and trade off scaling the base model versus adding experts under a fixed budget--turning merging from heuristic practice into a computationally efficient, planable alternative to multitask training. This suggests a scaling principle for distributed generative AI: predictable gains can be achieved by composing specialists, offering a complementary path toward AGI-level systems.