Принципиальный анализ парадигм оценки и проектирования глубокого обучения с подкреплением
Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms
July 8, 2026
Авторы: Ezgi Korkmaz
cs.AI
Аннотация
Начиная с использования глубоких нейронных сетей для аппроксимации функции ценности состояния-действия, что привело к победе в одной из самых сложных игр, до алгоритмических прорывов, позволивших решать задачи без явного указания правил, исследования в области обучения с подкреплением были в центре выдающегося научного прогресса последнего десятилетия. В данной работе мы сосредоточиваемся на ключевых составляющих этого исследовательского прогресса и анализируем канонические парадигмы оценки и проектирования в обучении с подкреплением. Мы вводим теоретические основы законов масштабирования в обучении с подкреплением и показываем, что асимптотическая производительность алгоритмов обучения с подкреплением не имеет монотонной зависимости между рейтингами производительности и режимами данных. Мы проводим крупномасштабные эксперименты, и наши результаты демонстрируют, что линия исследований в области обучения с подкреплением в рамках канонических парадигм проектирования и оценки привела к неверным выводам. Наш анализ и результаты предоставляют ключевой анализ масштабирования, емкости и сложности глубокого обучения с подкреплением.
English
Starting from the utilization of deep neural networks to approximate the state-action value function that led to winning one of the most challenging games, to algorithmic advancements that allowed solving problems without even explicitly stating the rules of the challenge at hand, reinforcement learning research has been the center of remarkable scientific progress for the past decade. In this paper, we focus on the key ingredients of this research progress and we analyze the canonical evaluation and design paradigms in reinforcement learning. We introduce the theoretical foundations of scaling laws in reinforcement learning and show that the asymptotic performance of reinforcement learning algorithms does not have a monotone relationship between performance rankings and data-regimes. We conduct large-scale experiments and our results demonstrate that a line of reinforcement learning research under the canonical design and evaluation paradigms resulted in incorrect conclusions. Our analysis and results provide a core analysis on scaling, capacity and complexity of deep reinforcement learning.