Prinzipienbasierte Analyse von Deep Reinforcement Learning Evaluierungs- und Designparadigmen
Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms
July 8, 2026
Autoren: Ezgi Korkmaz
cs.AI
Zusammenfassung
Ausgehend von der Nutzung tiefer neuronaler Netze zur Approximation der Zustands-Aktions-Wertfunktion, die zum Sieg in einem der anspruchsvollsten Spiele führte, bis hin zu algorithmischen Fortschritten, die es ermöglichten, Probleme zu lösen, ohne die Regeln der jeweiligen Herausforderung explizit anzugeben, stand die Forschung im Bereich des bestärkenden Lernens im Mittelpunkt bemerkenswerter wissenschaftlicher Fortschritte des letzten Jahrzehnts. In dieser Arbeit konzentrieren wir uns auf die wesentlichen Bestandteile dieses Forschungsfortschritts und analysieren die kanonischen Evaluations- und Entwurfsparadigmen im bestärkenden Lernen. Wir führen die theoretischen Grundlagen von Skalierungsgesetzen im bestärkenden Lernen ein und zeigen, dass die asymptotische Leistung von Algorithmen des bestärkenden Lernens keinen monotonen Zusammenhang zwischen Leistungsbewertungen und Datenregimen aufweist. Wir führen großangelegte Experimente durch, und unsere Ergebnisse belegen, dass eine Reihe von Forschungsarbeiten im bestärkenden Lernen unter den kanonischen Entwurfs- und Evaluationsparadigmen zu falschen Schlussfolgerungen geführt hat. Unsere Analyse und Ergebnisse liefern eine grundlegende Untersuchung der Skalierung, Kapazität und Komplexität des tiefen bestärkenden Lernens.
English
Starting from the utilization of deep neural networks to approximate the state-action value function that led to winning one of the most challenging games, to algorithmic advancements that allowed solving problems without even explicitly stating the rules of the challenge at hand, reinforcement learning research has been the center of remarkable scientific progress for the past decade. In this paper, we focus on the key ingredients of this research progress and we analyze the canonical evaluation and design paradigms in reinforcement learning. We introduce the theoretical foundations of scaling laws in reinforcement learning and show that the asymptotic performance of reinforcement learning algorithms does not have a monotone relationship between performance rankings and data-regimes. We conduct large-scale experiments and our results demonstrate that a line of reinforcement learning research under the canonical design and evaluation paradigms resulted in incorrect conclusions. Our analysis and results provide a core analysis on scaling, capacity and complexity of deep reinforcement learning.