ChatPaper.aiChatPaper

AEM: Modulação Adaptativa de Entropia para Aprendizagem por Reforço Agencial Multi-Turn

AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning

May 8, 2026
Autores: Haotian Zhao, Songlin Zhou, Yuxin Zhang, Stephen S. -T. Yau, Wenyu Zhang, Lun Tian, Tianshu Zhu, Yifeng Huang, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu
cs.AI

Resumo

A aprendizagem por reforço (RL) melhorou substancialmente a capacidade de agentes baseados em modelos de linguagem de grande escala (LLMs) interagirem com ambientes e resolverem tarefas de múltiplas etapas. No entanto, uma RL agentiva eficaz continua desafiadora: recompensas esparsas baseadas apenas em resultados finais fornecem orientação limitada para atribuir crédito a passos individuais dentro de trajetórias de interação longas. Abordagens existentes frequentemente introduzem supervisão intermediária densa, como modelos de recompensa processual ou sinais auxiliares auto-supervisionados, o que aumenta a complexidade da supervisão e do ajuste fino, podendo limitar a generalização entre tarefas e domínios. Apresentamos o AEM, um método de atribuição de crédito livre de supervisão que modula adaptativamente a dinâmica de entropia durante o treinamento de RL para melhorar o equilíbrio entre exploração e aproveitamento. Como na RL agentiva o ambiente é tipicamente afetado por uma resposta completa, e não por um token individual, nossa análise eleva a dinâmica de entropia do nível do token para o nível da resposta, alinhando a estimativa de incerteza com a granularidade efetiva das ações dos agentes LLM e reduzindo a sensibilidade ao ruído amostral no nível de tokens. Mostramos ainda que o desvio de entropia sob atualizações de gradiente natural é governado pela interação entre a vantagem da resposta amostrada e sua surpresa relativa. Motivado por esse resultado, o AEM deriva uma proxy prática de incerteza no nível de resposta e a utiliza para reescalar as vantagens, aproveitando o equilíbrio evolutivo entre amostras positivas e negativas para transitar naturalmente da exploração para o aproveitamento. Experimentos extensivos em ALFWorld, WebShop e SWE-bench-Verified com modelos variando de 1,5B a 32B demonstram que o AEM melhora consistentemente linhas de base fortes de RL, incluindo um ganho de +1,4% quando integrado a um arcabouço de treinamento de RL de engenharia de software de última geração.
English
Reinforcement learning (RL) has substantially improved the ability of large language model (LLM) agents to interact with environments and solve multi-turn tasks. However, effective agentic RL remains challenging: sparse outcome-only rewards provide limited guidance for assigning credit to individual steps within long interaction trajectories. Existing approaches often introduce dense intermediate supervision, such as process reward models or auxiliary self-supervised signals, which increases supervision and tuning complexity and may limit generalization across tasks and domains. We present AEM, a supervision-free credit assignment method that adaptively modulates entropy dynamics during RL training to improve the exploration-exploitation trade-off. Since in agentic RL the environment is typically affected by a complete response, rather than an individual token, our analysis lifts entropy dynamics from the token level to the response level, aligning uncertainty estimation with the effective action granularity of LLM agents and reducing sensitivity to token-level sampling noise. We further show that entropy drift under natural-gradient updates is governed by the interaction between the sampled-response advantage and its relative surprisal. Motivated by this result, AEM derives a practical response-level uncertainty proxy and uses it to rescale advantages, leveraging the evolving balance between positive and negative samples to naturally transition from exploration to exploitation. Extensive experiments on ALFWorld, WebShop, and SWE-bench-Verified with models ranging from 1.5B to 32B demonstrate that AEM consistently improves strong RL baselines, including a +1.4\% gain when integrated into a state-of-the-art software-engineering RL training framework.