ChatPaper.aiChatPaper

Muon peut-il affiner les modèles pré-entraînés par Adam ?

Can Muon Fine-tune Adam-Pretrained Models?

May 11, 2026
Auteurs: Xingyu Qu, Peigeng Huang, Samuel Horvath
cs.AI

Résumé

Muon est apparu comme une alternative efficace à Adam pour le pré-entraînement, mais reste sous-utilisé pour le fine-tuning. Un obstacle majeur est que la plupart des modèles ouverts sont pré-entraînés avec Adam, et le passage naïf à Muon pour le fine-tuning entraîne une dégradation des performances en raison d'une inadéquation de l'optimiseur. Nous étudions cette inadéquation à travers des expériences contrôlées et la relions aux biais implicites distincts d'Adam et de Muon. Nous apportons la preuve que cette inadéquation perturbe les connaissances pré-entraînées, et que cette perturbation est proportionnelle à la force de mise à jour. Cela nous amène à émettre l'hypothèse qu'en contraignant les mises à jour, on devrait atténuer l'inadéquation. Nous validons cela avec LoRA : sur des tâches de langage et de vision, LoRA réduit l'écart de performance entre Adam et Muon observé en fine-tuning complet. Des études sur le rang de LoRA, l'oubli catastrophique et les variantes de LoRA confirment en outre que la sévérité de l'inadéquation est corrélée à la force de mise à jour. Ces résultats éclairent la manière dont l'inadéquation de l'optimiseur affecte le fine-tuning et comment elle peut être atténuée. Notre code est disponible à l'adresse https://github.com/XingyuQu/muon-finetune.
English
Muon has emerged as an efficient alternative to Adam for pretraining, yet remains underused for fine-tuning. A key obstacle is that most open models are pretrained with Adam, and naively switching to Muon for fine-tuning leads to degraded performance due to an optimizer mismatch. We investigate this mismatch through controlled experiments and relate it to the distinct implicit biases of Adam and Muon. We provide evidence that the mismatch disrupts pretrained knowledge, and that this disruption scales with update strength. This leads us to hypothesize that constraining updates should mitigate the mismatch. We validate this with LoRA: across language and vision tasks, LoRA reduces the performance gap between Adam and Muon observed under full fine-tuning. Studies on LoRA rank, catastrophic forgetting, and LoRA variants further confirm that mismatch severity correlates with update strength. These results shed light on how optimizer mismatch affects fine-tuning and how it can be mitigated. Our code is available at https://github.com/XingyuQu/muon-finetune.