ChatPaper.aiChatPaper

OmniOpt : Taxonomie, Géométrie et Évaluation comparative des optimiseurs modernes

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers

July 4, 2026
Auteurs: Siyuan Li, Jiabao Pan, Yumou Liu, Zhuoli Ouyang, Xin Jin, Xinglong Xu, Jingxuan Wei, Shengye Pang, Jintao Che, Xuanhe Zhou, Conghui He, Cheng Tan
cs.AI

Résumé

Le choix de l'optimiseur pour l'entraînement de modèles à grande échelle est devenu une décision de conception au niveau système, contrainte conjointement par le calcul, la mémoire, le budget de réglage et la diversité des tâches, tandis que le paysage de plus d'une centaine de méthodes reste fragmenté. Nous présentons donc OmniOpt, une synthèse unifiée et un livre de référence pour l'évaluation comparative des optimiseurs destinés à la communauté de recherche. OmniOpt repose sur quatre composants couplés. Premièrement, nous traitons chaque mise à jour d'optimiseur comme une transformation structurée à travers un métapipeline en cinq étapes, et montrons que la plupart des méthodes n'activent qu'une ou deux de ces étapes. Deuxièmement, nous utilisons des oracles de minimisation linéaire sous contrainte de norme (LMO) pour unifier différents optimiseurs. Troisièmement, ces deux perspectives fondent une taxonomie à deux dimensions : l'une assigne chaque méthode à une famille de mécanismes, et l'autre enregistre les objectifs d'entraînement mesurables qu'elle vise à améliorer. Quatrièmement, et au cœur de cet article, nous instancions la taxonomie complète dans un benchmark unifié multidomaine couvrant des optimiseurs représentatifs, des échelles de modèles et des régimes d'entraînement allant du pré-entraînement de modèles de langage à la classification d'images, en analysant systématiquement chaque famille de méthodes selon plusieurs objectifs d'effet et en exposant leurs compromis. OmniOpt fournit ainsi à la communauté de recherche un système de coordonnées opérationnel pour sélectionner des optimiseurs sous des hypothèses explicites de mécanisme et d'objectif, et trace une direction pour le développement futur de la communauté des optimiseurs.
English
Optimizer selection for large-scale model training has become a system-level design decision constrained jointly by compute, memory, tuning budget, and task diversity, yet the landscape of over one hundred methods remains fragmented. We therefore present OmniOpt, a unified survey and benchmark cookbook of optimizers for the research community. OmniOpt rests on four coupled components. First, we treat every optimizer update as a structured transformation through a five-stage meta-pipeline, and show that most methods engage only one or two of these stages. Second, we use norm-constrained linear minimization oracles (LMOs) to unify different optimizers. Third, these two views ground a dual-dimension taxonomy, one dimension assigning each method to a mechanism family and the other recording the measurable training objectives it aims to improve. Fourth, and at the core of this paper, we instantiate the full taxonomy in a unified cross-domain benchmark spanning representative optimizers, model scales, and training regimes from language model pretraining to image classification, systematically analyzing each method family across multiple effect objectives and laying out their trade-offs. OmniOpt thus supplies the research community with an operational coordinate system for selecting optimizers under explicit mechanism and objective assumptions, and charts a direction for the future development of the optimizer community.