Analyse principielle des paradigmes d'évaluation et de conception de l'apprentissage par renforcement profond
Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms
July 8, 2026
Auteurs: Ezgi Korkmaz
cs.AI
Résumé
En partant de l’utilisation de réseaux de neurones profonds pour approximer la fonction de valeur état-action, qui a permis de remporter l’un des jeux les plus difficiles, jusqu’aux avancées algorithmiques ayant permis de résoudre des problèmes sans même énoncer explicitement les règles du défi en question, la recherche en apprentissage par renforcement a été au cœur de progrès scientifiques remarquables au cours de la dernière décennie. Dans cet article, nous nous concentrons sur les ingrédients clés de ces progrès de recherche et analysons les paradigmes canoniques d’évaluation et de conception en apprentissage par renforcement. Nous introduisons les fondements théoriques des lois d’échelle en apprentissage par renforcement et montrons que la performance asymptotique des algorithmes d’apprentissage par renforcement n’entretient pas de relation monotone entre les classements de performance et les régimes de données. Nous menons des expériences à grande échelle et nos résultats démontrent qu’un courant de recherche en apprentissage par renforcement, sous les paradigmes canoniques de conception et d’évaluation, a conduit à des conclusions incorrectes. Notre analyse et nos résultats fournissent une analyse fondamentale sur l’échelle, la capacité et la complexité de l’apprentissage par renforcement profond.
English
Starting from the utilization of deep neural networks to approximate the state-action value function that led to winning one of the most challenging games, to algorithmic advancements that allowed solving problems without even explicitly stating the rules of the challenge at hand, reinforcement learning research has been the center of remarkable scientific progress for the past decade. In this paper, we focus on the key ingredients of this research progress and we analyze the canonical evaluation and design paradigms in reinforcement learning. We introduce the theoretical foundations of scaling laws in reinforcement learning and show that the asymptotic performance of reinforcement learning algorithms does not have a monotone relationship between performance rankings and data-regimes. We conduct large-scale experiments and our results demonstrate that a line of reinforcement learning research under the canonical design and evaluation paradigms resulted in incorrect conclusions. Our analysis and results provide a core analysis on scaling, capacity and complexity of deep reinforcement learning.