Descoberta de Interfaces de Aprendizado por Reforço com Grandes Modelos de Linguagem
Discovering Reinforcement Learning Interfaces with Large Language Models
May 5, 2026
Autores: Akshat Singh Jaswal, Ashish Baghel, Paras Chopra
cs.AI
Resumo
Sistemas de aprendizado por reforço dependem de interfaces de ambiente que especificam observações e funções de recompensa, porém construir essas interfaces para novas tarefas frequentemente exige esforço manual substancial. Embora trabalhos recentes tenham automatizado o design de recompensas usando modelos de linguagem de grande escala (LLMs), essas abordagens assumem observações fixas e não abordam o desafio mais amplo de sintetizar interfaces completas de tarefas. Estudamos a descoberta de interfaces de tarefas de RL a partir do estado bruto do simulador, onde tanto os mapeamentos de observação quanto as funções de recompensa devem ser gerados. Propomos o LIMEN (Código disponível em https://github.com/Lossfunk/LIMEN), um framework evolutivo guiado por LLM que produz interfaces candidatas como programas executáveis e as refina iterativamente usando feedback de treinamento de política. Em tarefas discretas inéditas de gridworld e domínios contínuos de controle abrangendo locomoção e manipulação, a evolução conjunta de observações e recompensas descobre interfaces eficazes dada apenas uma métrica de sucesso no nível de trajetória, enquanto a otimização de qualquer um dos componentes isoladamente falha em pelo menos um domínio. Esses resultados demonstram que a construção automática de interfaces de RL a partir do estado bruto pode reduzir substancialmente o esforço manual e que os componentes de observação e recompensa frequentemente se beneficiam de codesign, uma vez que a otimização de um único componente falha catastroficamente em pelo menos um domínio em nossa suíte de avaliação.
English
Reinforcement learning systems rely on environment interfaces that specify observations and reward functions, yet constructing these interfaces for new tasks often requires substantial manual effort. While recent work has automated reward design using large language models (LLMs), these approaches assume fixed observations and do not address the broader challenge of synthesizing complete task interfaces. We study RL task interface discovery from raw simulator state, where both observation mappings and reward functions must be generated. We propose LIMEN (Code available at https://github.com/Lossfunk/LIMEN), a LLM guided evolutionary framework that produces candidate interfaces as executable programs and iteratively refines them using policy training feedback. Across novel discrete gridworld tasks and continuous control domains spanning locomotion and manipulation, joint evolution of observations and rewards discovers effective interfaces given only a trajectory-level success metric, while optimizing either component alone fails on at least one domain. These results demonstrate that automatic construction of RL interfaces from raw state can substantially reduce manual engineering and that observation and reward components often benefit from co-design, as single-component optimization fails catastrophically on at least one domain in our evaluation suite.