ChatPaper.aiChatPaper

Pode o Muon realizar o ajuste fino de modelos pré-treinados com Adam?

Can Muon Fine-tune Adam-Pretrained Models?

May 11, 2026
Autores: Xingyu Qu, Peigeng Huang, Samuel Horvath
cs.AI

Resumo

O Muon surgiu como uma alternativa eficiente ao Adam para pré-treinamento, mas ainda é subutilizado para ajuste fino. Um obstáculo principal é que a maioria dos modelos abertos é pré-treinada com Adam, e a simples troca para Muon no ajuste fino leva a uma degradação no desempenho devido a uma incompatibilidade de otimizadores. Investigamos essa incompatibilidade por meio de experimentos controlados e a relacionamos com os vieses implícitos distintos do Adam e do Muon. Fornecemos evidências de que a incompatibilidade perturba o conhecimento pré-treinado, e que essa perturbação escala com a intensidade da atualização. Isso nos leva a hipotetizar que restringir as atualizações deve mitigar a incompatibilidade. Validamos isso com LoRA: em tarefas de linguagem e visão, o LoRA reduz a diferença de desempenho entre Adam e Muon observada sob ajuste fino completo. Estudos sobre o rank do LoRA, esquecimento catastrófico e variantes do LoRA confirmam ainda que a gravidade da incompatibilidade se correlaciona com a intensidade da atualização. Esses resultados esclarecem como a incompatibilidade de otimizadores afeta o ajuste fino e como ela pode ser mitigada. Nosso código está disponível em https://github.com/XingyuQu/muon-finetune.
English
Muon has emerged as an efficient alternative to Adam for pretraining, yet remains underused for fine-tuning. A key obstacle is that most open models are pretrained with Adam, and naively switching to Muon for fine-tuning leads to degraded performance due to an optimizer mismatch. We investigate this mismatch through controlled experiments and relate it to the distinct implicit biases of Adam and Muon. We provide evidence that the mismatch disrupts pretrained knowledge, and that this disruption scales with update strength. This leads us to hypothesize that constraining updates should mitigate the mismatch. We validate this with LoRA: across language and vision tasks, LoRA reduces the performance gap between Adam and Muon observed under full fine-tuning. Studies on LoRA rank, catastrophic forgetting, and LoRA variants further confirm that mismatch severity correlates with update strength. These results shed light on how optimizer mismatch affects fine-tuning and how it can be mitigated. Our code is available at https://github.com/XingyuQu/muon-finetune.