ChatPaper.aiChatPaper

Kunnen Muon Adam-voorgetrainde modellen finetunen?

Can Muon Fine-tune Adam-Pretrained Models?

May 11, 2026
Auteurs: Xingyu Qu, Peigeng Huang, Samuel Horvath
cs.AI

Samenvatting

Muon is naar voren gekomen als een efficiënt alternatief voor Adam bij het vooraf trainen van modellen, maar wordt nog steeds weinig gebruikt voor fine-tuning. Een belangrijk obstakel is dat de meeste open modellen zijn voorgetraind met Adam, en een ondoordachte overstap naar Muon voor fine-tuning leidt tot verminderde prestaties vanwege een mismatch tussen de optimalisatoren. Wij onderzoeken deze mismatch door middel van gecontroleerde experimenten en leggen een verband met de verschillende impliciete biases van Adam en Muon. Wij leveren bewijs dat de mismatch de vooraf opgebouwde kennis verstoort, en dat deze verstoring schaalt met de sterkte van de updates. Dit leidt ons tot de hypothese dat het beperken van updates de mismatch zou moeten verminderen. Wij valideren dit met LoRA: over verschillende taal- en visietaken reduceert LoRA de prestatiekloof tussen Adam en Muon die wordt waargenomen bij volledige fine-tuning. Onderzoeken naar LoRA-rang, catastrofale vergetelheid en LoRA-varianten bevestigen verder dat de ernst van de mismatch correleert met de sterkte van de updates. Deze resultaten werpen licht op hoe optimizer-mismatch fine-tuning beïnvloedt en hoe dit kan worden gemitigeerd. Onze code is beschikbaar op https://github.com/XingyuQu/muon-finetune.
English
Muon has emerged as an efficient alternative to Adam for pretraining, yet remains underused for fine-tuning. A key obstacle is that most open models are pretrained with Adam, and naively switching to Muon for fine-tuning leads to degraded performance due to an optimizer mismatch. We investigate this mismatch through controlled experiments and relate it to the distinct implicit biases of Adam and Muon. We provide evidence that the mismatch disrupts pretrained knowledge, and that this disruption scales with update strength. This leads us to hypothesize that constraining updates should mitigate the mismatch. We validate this with LoRA: across language and vision tasks, LoRA reduces the performance gap between Adam and Muon observed under full fine-tuning. Studies on LoRA rank, catastrophic forgetting, and LoRA variants further confirm that mismatch severity correlates with update strength. These results shed light on how optimizer mismatch affects fine-tuning and how it can be mitigated. Our code is available at https://github.com/XingyuQu/muon-finetune.