Análisis fundamentado de los paradigmas de evaluación y diseño en el aprendizaje por refuerzo profundo
Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms
July 8, 2026
Autores: Ezgi Korkmaz
cs.AI
Resumen
Desde la utilización de redes neuronales profundas para aproximar la función de valor estado-acción, que condujo a la victoria en uno de los juegos más desafiantes, hasta los avances algorítmicos que permitieron resolver problemas sin siquiera enunciar explícitamente las reglas del desafío en cuestión, la investigación en aprendizaje por refuerzo ha sido el centro de un notable progreso científico durante la última década. En este artículo, nos centramos en los ingredientes clave de este progreso investigativo y analizamos los paradigmas canónicos de evaluación y diseño en el aprendizaje por refuerzo. Introducimos los fundamentos teóricos de las leyes de escalado en el aprendizaje por refuerzo y demostramos que el rendimiento asintótico de los algoritmos de aprendizaje por refuerzo no presenta una relación monótona entre las clasificaciones de rendimiento y los regímenes de datos. Realizamos experimentos a gran escala y nuestros resultados demuestran que una línea de investigación en aprendizaje por refuerzo bajo los paradigmas canónicos de diseño y evaluación condujo a conclusiones incorrectas. Nuestro análisis y resultados proporcionan un análisis central sobre el escalado, la capacidad y la complejidad del aprendizaje por refuerzo profundo.
English
Starting from the utilization of deep neural networks to approximate the state-action value function that led to winning one of the most challenging games, to algorithmic advancements that allowed solving problems without even explicitly stating the rules of the challenge at hand, reinforcement learning research has been the center of remarkable scientific progress for the past decade. In this paper, we focus on the key ingredients of this research progress and we analyze the canonical evaluation and design paradigms in reinforcement learning. We introduce the theoretical foundations of scaling laws in reinforcement learning and show that the asymptotic performance of reinforcement learning algorithms does not have a monotone relationship between performance rankings and data-regimes. We conduct large-scale experiments and our results demonstrate that a line of reinforcement learning research under the canonical design and evaluation paradigms resulted in incorrect conclusions. Our analysis and results provide a core analysis on scaling, capacity and complexity of deep reinforcement learning.