ChatPaper.aiChatPaper

Análise Baseada em Princípios dos Paradigmas de Avaliação e Projeto de Aprendizado por Reforço Profundo

Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms

July 8, 2026
Autores: Ezgi Korkmaz
cs.AI

Resumo

Partindo da utilização de redes neurais profundas para aproximar a função estado-ação valor, que levou à vitória num dos jogos mais desafiantes, até aos avanços algorítmicos que permitiram resolver problemas sem sequer explicitar explicitamente as regras do desafio em questão, a investigação em aprendizagem por reforço tem estado no centro de um notável progresso científico na última década. Neste artigo, focamo-nos nos ingredientes-chave deste progresso de investigação e analisamos os paradigmas canónicos de avaliação e conceção em aprendizagem por reforço. Introduzimos os fundamentos teóricos das leis de escala em aprendizagem por reforço e mostramos que o desempenho assintótico dos algoritmos de aprendizagem por reforço não apresenta uma relação monotónica entre as classificações de desempenho e os regimes de dados. Conduzimos experiências em larga escala e os nossos resultados demonstram que uma linha de investigação em aprendizagem por reforço sob os paradigmas canónicos de conceção e avaliação resultou em conclusões incorretas. A nossa análise e resultados fornecem uma análise central sobre escala, capacidade e complexidade da aprendizagem por reforço profunda.
English
Starting from the utilization of deep neural networks to approximate the state-action value function that led to winning one of the most challenging games, to algorithmic advancements that allowed solving problems without even explicitly stating the rules of the challenge at hand, reinforcement learning research has been the center of remarkable scientific progress for the past decade. In this paper, we focus on the key ingredients of this research progress and we analyze the canonical evaluation and design paradigms in reinforcement learning. We introduce the theoretical foundations of scaling laws in reinforcement learning and show that the asymptotic performance of reinforcement learning algorithms does not have a monotone relationship between performance rankings and data-regimes. We conduct large-scale experiments and our results demonstrate that a line of reinforcement learning research under the canonical design and evaluation paradigms resulted in incorrect conclusions. Our analysis and results provide a core analysis on scaling, capacity and complexity of deep reinforcement learning.