OmniOpt: Taxonomia, Geometria e Benchmarking de Otimizadores Modernos
OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
July 4, 2026
Autores: Siyuan Li, Jiabao Pan, Yumou Liu, Zhuoli Ouyang, Xin Jin, Xinglong Xu, Jingxuan Wei, Shengye Pang, Jintao Che, Xuanhe Zhou, Conghui He, Cheng Tan
cs.AI
Resumo
A seleção de otimizadores para treinamento de modelos em larga escala tornou-se uma decisão de design a nível de sistema, restrita conjuntamente por computação, memória, orçamento de ajuste e diversidade de tarefas, embora o panorama de mais de cem métodos permaneça fragmentado. Assim, apresentamos o OmniOpt, um levantamento unificado e um guia prático de referência de otimizadores para a comunidade de pesquisa. O OmniOpt baseia-se em quatro componentes interligados. Primeiro, tratamos cada atualização de otimizador como uma transformação estruturada por meio de um meta-pipeline de cinco estágios e mostramos que a maioria dos métodos envolve apenas um ou dois desses estágios. Segundo, utilizamos oráculos de minimização linear com restrição de norma (LMOs) para unificar diferentes otimizadores. Terceiro, essas duas visões fundamentam uma taxonomia de dupla dimensão, onde uma dimensão atribui cada método a uma família de mecanismos e a outra registra os objetivos de treinamento mensuráveis que ele visa melhorar. Quarto, e no centro deste artigo, instanciamos a taxonomia completa em um benchmark unificado entre domínios, abrangendo otimizadores representativos, escalas de modelo e regimes de treinamento, desde pré-treinamento de modelos de linguagem até classificação de imagens, analisando sistematicamente cada família de métodos em múltiplos efeitos objetivos e expondo suas compensações. Assim, o OmniOpt fornece à comunidade de pesquisa um sistema de coordenadas operacional para seleção de otimizadores sob pressupostos explícitos de mecanismo e objetivo, e traça uma direção para o desenvolvimento futuro da comunidade de otimizadores.
English
Optimizer selection for large-scale model training has become a system-level design decision constrained jointly by compute, memory, tuning budget, and task diversity, yet the landscape of over one hundred methods remains fragmented. We therefore present OmniOpt, a unified survey and benchmark cookbook of optimizers for the research community. OmniOpt rests on four coupled components. First, we treat every optimizer update as a structured transformation through a five-stage meta-pipeline, and show that most methods engage only one or two of these stages. Second, we use norm-constrained linear minimization oracles (LMOs) to unify different optimizers. Third, these two views ground a dual-dimension taxonomy, one dimension assigning each method to a mechanism family and the other recording the measurable training objectives it aims to improve. Fourth, and at the core of this paper, we instantiate the full taxonomy in a unified cross-domain benchmark spanning representative optimizers, model scales, and training regimes from language model pretraining to image classification, systematically analyzing each method family across multiple effect objectives and laying out their trade-offs. OmniOpt thus supplies the research community with an operational coordinate system for selecting optimizers under explicit mechanism and objective assumptions, and charts a direction for the future development of the optimizer community.