Leis de Escala da Fusão de Modelos em Grandes Modelos de Linguagem
Model Merging Scaling Laws in Large Language Models
May 11, 2026
Autores: Yuanyi Wang, Yanggan Gu, Yiming Zhang, Qi Zhou, Zhaoyi Yan, Congkai Xie, Xinyao Wang, Jianbo Yuan, Hongxia Yang
cs.AI
Resumo
Estudamos leis de escala empíricas para a fusão de modelos de linguagem medida por entropia cruzada. Apesar de seu amplo uso prático, a fusão carece de uma regra quantitativa que prediga os retornos à medida que adicionamos especialistas ou escalamos o tamanho do modelo. Identificamos uma lei de potência compacta que relaciona o tamanho do modelo e o número de especialistas: o piso dependente do tamanho diminui com a capacidade do modelo, enquanto a cauda da fusão exibe retornos decrescentes claros no número de especialistas. A lei se mantém intra-domínio e inter-domínio, ajusta-se precisamente às curvas medidas em diversas arquiteturas e métodos (Average, TA, TIES, DARE) e explica duas regularidades robustas: a maioria dos ganhos ocorre no início, e a variabilidade diminui à medida que mais especialistas são incluídos. Com base nisso, apresentamos uma teoria simples que explica por que os ganhos caem aproximadamente como 1/k e relaciona o piso e a cauda a propriedades do modelo base e à diversidade entre domínios. Essa lei possibilita o planejamento preditivo: estimar quantos especialistas são necessários para atingir uma perda alvo, decidir quando parar de adicionar especialistas e fazer compensações entre escalar o modelo base e adicionar especialistas sob um orçamento fixo – transformando a fusão de uma prática heurística em uma alternativa computacionalmente eficiente e planejável ao treinamento multitarefa. Isso sugere um princípio de escala para IA generativa distribuída: ganhos previsíveis podem ser alcançados pela composição de especialistas, oferecendo um caminho complementar em direção a sistemas de nível de IAG.
English
We study empirical scaling laws for language model merging measured by cross-entropy. Despite its wide practical use, merging lacks a quantitative rule that predicts returns as we add experts or scale the model size. We identify a compact power law that links model size and expert number: the size-dependent floor decreases with model capacity, while the merging tail exhibits clear diminishing returns in the number of experts. The law holds in-domain and cross-domain, tightly fits measured curves across diverse architectures and methods (Average, TA, TIES, DARE), and explains two robust regularities: most gains arrive early, and variability shrinks as more experts are included. Building on this, we present a simple theory that explains why gains fall roughly as 1/k and links the floor and tail to properties of the base model and the diversity across domains. This law enables predictive planning: estimate how many experts are needed to reach a target loss, decide when to stop adding experts, and trade off scaling the base model versus adding experts under a fixed budget--turning merging from heuristic practice into a computationally efficient, planable alternative to multitask training. This suggests a scaling principle for distributed generative AI: predictable gains can be achieved by composing specialists, offering a complementary path toward AGI-level systems.