ChatPaper.aiChatPaper

Representações Baseadas em Modelo Não Viesadas para Controle Contínuo Eficiente em Amostras

Debiased Model-based Representations for Sample-efficient Continuous Control

May 12, 2026
Autores: Jiafei Lyu, Zichuan Lin, Scott Fujimoto, Kai Yang, Yangkun Chen, Saiyong Yang, Zongqing Lu, Deheng Ye
cs.AI

Resumo

Representações baseadas em modelos recentemente se destacam como uma estrutura promissora que incorpora informações latentes de dinâmica nas representações para o aprendizado ator-crítico fora da política descendente. Elas combinam implicitamente as vantagens das abordagens livres de modelo e baseadas em modelo, evitando os custos de treinamento associados aos métodos baseados em modelo. No entanto, os métodos existentes de representação baseada em modelo podem falhar em capturar informações suficientes sobre variáveis relevantes e podem sofrer de superajuste às experiências iniciais no buffer de repetição. Isso gera viés na representação e no aprendizado ator-crítico, resultando em desempenho inferior. Para lidar com isso, propomos o algoritmo DR.Q (Representações Baseadas em Modelos com Viés Reduzido para Q-learning). O DR.Q maximiza explicitamente a informação mútua entre as representações do par estado-ação atual e o próximo estado, além de minimizar seus desvios, e amostra transições com repetição de experiência priorizada com atenuação. Avaliamos o DR.Q em diversos benchmarks de controle contínuo com um único conjunto de hiperparâmetros, e os resultados demonstram que o DR.Q pode igualar ou superar linhas de base fortes recentes, às vezes superando-as por uma margem significativa. Nosso código está disponível em https://github.com/dmksjfl/DR.Q.
English
Model-based representations recently stand out as a promising framework that embeds latent dynamics information into the representations for downstream off-policy actor-critic learning. It implicitly combines the advantages of both model-free and model-based approaches while avoiding the training costs associated with model-based methods. Nevertheless, existing model-based representation methods can fail to capture sufficient information about relevant variables and can overfit to early experiences in the replay buffer. These incur biases in representation and actor-critic learning, leading to inferior performance. To address this, we propose Debiased model-based Representations for Q-learning, tagged DR.Q algorithm. DR.Q explicitly maximizes the mutual information between the representations of the current state-action pair and the next state besides minimizing their deviations, and samples transitions with faded prioritized experience replay. We evaluate DR.Q on numerous continuous control benchmarks with a single set of hyperparameters, and the results demonstrate that DR.Q can match or surpass recent strong baselines, sometimes outperforming them by a large margin. Our code is available at https://github.com/dmksjfl/DR.Q.