OmniOpt: таксономия, геометрия и бенчмаркинг современных оптимизаторов
OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
July 4, 2026
Авторы: Siyuan Li, Jiabao Pan, Yumou Liu, Zhuoli Ouyang, Xin Jin, Xinglong Xu, Jingxuan Wei, Shengye Pang, Jintao Che, Xuanhe Zhou, Conghui He, Cheng Tan
cs.AI
Аннотация
Выбор оптимизатора для обучения крупномасштабных моделей стал проектным решением на системном уровне, ограниченным совместно вычислительными ресурсами, памятью, бюджетом на настройку и разнообразием задач, при этом ландшафт из более чем ста методов остаётся фрагментированным. Поэтому мы представляем OmniOpt — унифицированный обзор и сборник эталонных тестов оптимизаторов для исследовательского сообщества. OmniOpt основан на четырёх взаимосвязанных компонентах. Во-первых, мы рассматриваем каждое обновление оптимизатора как структурированное преобразование через пятиэтапный мета-конвейер и показываем, что большинство методов задействуют только один или два из этих этапов. Во-вторых, мы используем оракулы линейной минимизации с ограничением нормы (LMOs) для унификации различных оптимизаторов. В-третьих, эти два взгляда обосновывают двумерную таксономию, одно измерение которой относит каждый метод к семейству механизмов, а другое фиксирует измеримые цели обучения, которые он стремится улучшить. В-четвёртых, и это является ядром данной статьи, мы воплощаем полную таксономию в унифицированном междисциплинарном эталонном тесте, охватывающем репрезентативные оптимизаторы, масштабы моделей и режимы обучения — от предварительного обучения языковых моделей до классификации изображений, систематически анализируя каждое семейство методов по множеству целевых эффектов и описывая их компромиссы. Таким образом, OmniOpt предоставляет исследовательскому сообществу операционную систему координат для выбора оптимизаторов при явных допущениях о механизмах и целях, а также задаёт направление для будущего развития сообщества оптимизаторов.
English
Optimizer selection for large-scale model training has become a system-level design decision constrained jointly by compute, memory, tuning budget, and task diversity, yet the landscape of over one hundred methods remains fragmented. We therefore present OmniOpt, a unified survey and benchmark cookbook of optimizers for the research community. OmniOpt rests on four coupled components. First, we treat every optimizer update as a structured transformation through a five-stage meta-pipeline, and show that most methods engage only one or two of these stages. Second, we use norm-constrained linear minimization oracles (LMOs) to unify different optimizers. Third, these two views ground a dual-dimension taxonomy, one dimension assigning each method to a mechanism family and the other recording the measurable training objectives it aims to improve. Fourth, and at the core of this paper, we instantiate the full taxonomy in a unified cross-domain benchmark spanning representative optimizers, model scales, and training regimes from language model pretraining to image classification, systematically analyzing each method family across multiple effect objectives and laying out their trade-offs. OmniOpt thus supplies the research community with an operational coordinate system for selecting optimizers under explicit mechanism and objective assumptions, and charts a direction for the future development of the optimizer community.