ChatPaper.aiChatPaper

A^2TGPO: Otimização de Políticas de Turno-Grupo Agêntica com *Clipping* Adaptativo em Nível de Turno

A^2TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping

May 7, 2026
Autores: Dingwei Chen, Zefang Zong, Zhipeng Ma, Leo Luo, Yang Li, Chengming Li, Peng Chen, Jie Jiang
cs.AI

Resumo

O aprendizado por reforço para modelos de linguagem grandes (LLMs) agentivos geralmente depende de uma recompensa de resultado esparsa e em nível de trajetória, dificultando a avaliação da contribuição de chamadas individuais de ferramentas dentro de interações multi-turno. As abordagens existentes para tal atribuição de crédito de processo dependem de modelos de recompensa de processo externos separados que introduzem consumo adicional, ou de rollouts estruturais baseados em árvore que meramente redistribuem o sinal de resultado enquanto restringem a diversidade da trajetória. Uma alternativa promissora aproveita a mudança por turno na probabilidade prevista pela política para a verdade fundamental, denominada Ganho de Informação (GI), como um sinal de processo intrínseco sem um avaliador externo. No entanto, trabalhos anteriores sobre o aproveitamento de sinais de GI dentro do ciclo de treinamento de RL enfrentam três desafios sistemáticos: a normalização entre turnos que enfrentam contextos posicionais heterogêneos pode distorcer a posição relativa de turnos individuais, a acumulação de um número variável de termos faz com que as magnitudes de vantagem se desviem com a profundidade da trajetória, e um intervalo de corte fixo governa as atualizações da política de forma idêntica para turnos com sinais de GI vastamente diferentes. Neste artigo, propomos o A²TGPO (Otimização de Política por Grupo de Turnos Agentivos com Corte Adaptativo em Nível de Turno), que retém o GI como sinal intrínseco mas redesenha como ele é normalizado, acumulado e consumido: (i) normalização por grupo de turnos: normaliza o GI dentro de cada grupo (prompt, índice-do-turno) para que cada turno seja comparado apenas com pares na mesma profundidade de interação; (ii) acumulação descontada com reescala de variância: divide o GI normalizado acumulado pela raiz quadrada dos termos acumulados para manter magnitudes de vantagem comparáveis entre posições de turno; e (iii) corte adaptativo em nível de turno: modifica o intervalo de corte de cada turno com base em seu GI normalizado, ampliando a região de atualização para turnos informativos e estreitando-a para os não informativos.
English
Reinforcement learning for agentic large language models (LLMs) typically relies on a sparse, trajectory-level outcome reward, making it difficult to evaluate the contribution of individual tool-calls within multi-turn interactions. Existing approaches to such process credit assignment either depend on separate external process reward models that introduce additional consumption, or tree-based structural rollout that merely redistributes the outcome signal while constraining trajectory diversity. A promising alternative leverages the per-turn change in the policy's predicted probability of the ground-truth, termed Information Gain (IG), as an intrinsic process signal without an external evaluator. However, prior work on leveraging IG signals within the RL training loop faces three systematic challenges: normalizing across turns that face heterogeneous positional contexts can distort the relative standing of individual turns, accumulating a variable number of terms causes advantage magnitudes to drift with trajectory depth, and a fixed clipping range governs policy updates identically for turns with vastly different IG signals. In this paper, we propose A^2TGPO (Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping), which retains IG as the intrinsic signal but re-designs how it is normalized, accumulated, and consumed: (i) turn-group normalization: normalizes IG within each (prompt, turn-index) group so that each turn is compared only against peers at the same interaction depth; (ii) variance-rescaled discounted accumulation: divides cumulative normalized IG by square root of accumulated terms to keep advantage magnitudes comparable across turn positions; and (iii) adaptive turn-level clipping: modulates each turn's clipping range based on its normalized IG, widening the update region for informative turns and narrowing it for uninformative ones.