ChatPaper.aiChatPaper

StraTA: Incentivando o Aprendizado por Reforço Agêntico com Abstração Estratégica de Trajetória

StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction

May 7, 2026
Autores: Xiangyuan Xue, Yifan Zhou, Zidong Wang, Shengji Tang, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin
cs.AI

Resumo

Os grandes modelos de linguagem (LLMs) são cada vez mais utilizados como agentes interativos, mas otimizá-los para tomada de decisão de longo horizonte permanece difícil porque os métodos atuais são amplamente puramente reativos, o que fragiliza tanto a exploração quanto a atribuição de crédito ao longo de trajetórias estendidas. Neste trabalho, apresentamos a Abstração de Trajetória Estratégica (StraTA), uma estrutura simples que introduz uma estratégia explícita em nível de trajetória no aprendizado por reforço (RL) agentivo. O StraTA amostra uma estratégia compacta do estado inicial da tarefa, condiciona ações subsequentes a essa estratégia e treina a geração de estratégias e a execução de ações conjuntamente com um projeto de rollout hierárquico estilo GRPO, aprimorado ainda por rollouts de estratégia diversificados e autojulgamento crítico. Experimentos no ALFWorld, WebShop e SciWorld mostram que o StraTA melhora consistentemente tanto a eficiência amostral quanto o desempenho final em relação às linhas de base fortes. O StraTA atinge taxas de sucesso de 93,1% no ALFWorld e 84,2% no WebShop. No SciWorld, o StraTA alcança uma pontuação geral de 63,5%, superando modelos proprietários de última geração.
English
Large language models (LLMs) are increasingly used as interactive agents, but optimizing them for long-horizon decision making remains difficult because current methods are largely purely reactive, which weakens both exploration and credit assignment over extended trajectories. In this work, we present Strategic Trajectory Abstraction (StraTA), a simple framework that introduces an explicit trajectory-level strategy into agentic reinforcement learning (RL). StraTA samples a compact strategy from the initial task state, conditions subsequent actions on that strategy, and trains strategy generation and action execution jointly with a hierarchical GRPO-style rollout design, further enhanced by diverse strategy rollout and critical self-judgment. Experiments on ALFWorld, WebShop, and SciWorld show that StraTA consistently improves both sample efficiency and final performance over strong baselines. StraTA reaches success rates of 93.1% on ALFWorld and 84.2% on WebShop. On SciWorld, StraTA attains a 63.5% overall score, outperforming frontier closed-source models.