OmniOpt: Taxonomía, Geometría y Benchmarking de Optimizadores Modernos
OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
July 4, 2026
Autores: Siyuan Li, Jiabao Pan, Yumou Liu, Zhuoli Ouyang, Xin Jin, Xinglong Xu, Jingxuan Wei, Shengye Pang, Jintao Che, Xuanhe Zhou, Conghui He, Cheng Tan
cs.AI
Resumen
La selección del optimizador para el entrenamiento de modelos a gran escala se ha convertido en una decisión de diseño a nivel de sistema, condicionada conjuntamente por la computación, la memoria, el presupuesto de ajuste y la diversidad de tareas, aunque el panorama de más de cien métodos sigue estando fragmentado. Por ello presentamos OmniOpt, un estudio unificado y un recetario de referencia (benchmark) de optimizadores para la comunidad investigadora. OmniOpt se apoya en cuatro componentes acoplados. En primer lugar, tratamos cada actualización del optimizador como una transformación estructurada a través de un meta-pipeline de cinco etapas, y mostramos que la mayoría de los métodos solo involucran una o dos de estas etapas. En segundo lugar, empleamos oráculos de minimización lineal con restricciones de norma (LMOs, por sus siglas en inglés) para unificar diferentes optimizadores. En tercer lugar, estas dos visiones fundamentan una taxonomía de doble dimensión: una dimensión asigna cada método a una familia de mecanismos, y la otra registra los objetivos de entrenamiento medibles que dicho método pretende mejorar. En cuarto lugar, y como núcleo de este artículo, instanciamos la taxonomía completa en un punto de referencia unificado que abarca múltiples dominios, incluyendo optimizadores representativos, escalas de modelo y regímenes de entrenamiento, desde el preentrenamiento de modelos lingüísticos hasta la clasificación de imágenes, analizando sistemáticamente cada familia de métodos en múltiples efectos objetivos y detallando sus compensaciones. OmniOpt proporciona así a la comunidad investigadora un sistema de coordenadas operativo para seleccionar optimizadores bajo supuestos explícitos de mecanismo y objetivo, y traza una dirección para el desarrollo futuro de la comunidad de optimizadores.
English
Optimizer selection for large-scale model training has become a system-level design decision constrained jointly by compute, memory, tuning budget, and task diversity, yet the landscape of over one hundred methods remains fragmented. We therefore present OmniOpt, a unified survey and benchmark cookbook of optimizers for the research community. OmniOpt rests on four coupled components. First, we treat every optimizer update as a structured transformation through a five-stage meta-pipeline, and show that most methods engage only one or two of these stages. Second, we use norm-constrained linear minimization oracles (LMOs) to unify different optimizers. Third, these two views ground a dual-dimension taxonomy, one dimension assigning each method to a mechanism family and the other recording the measurable training objectives it aims to improve. Fourth, and at the core of this paper, we instantiate the full taxonomy in a unified cross-domain benchmark spanning representative optimizers, model scales, and training regimes from language model pretraining to image classification, systematically analyzing each method family across multiple effect objectives and laying out their trade-offs. OmniOpt thus supplies the research community with an operational coordinate system for selecting optimizers under explicit mechanism and objective assumptions, and charts a direction for the future development of the optimizer community.