ChatPaper.aiChatPaper

Logits Antigos Ausentes em RL Agêntico Assíncrono: Incompatibilidade Semântica e Métodos de Reparo para Correção Fora da Política

Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

May 12, 2026
Autores: Zhong Guan, Yongjian Guo, Haoran Sun, Wen Huang, Shuai Di, Xiong Jun Wu, Likang Wu, Hongke Zhao
cs.AI

Resumo

O aprendizado por reforço assíncrono melhora o throughput de rollouts para agentes de modelos de linguagem de grande porte ao desacoplar a geração de amostras da otimização da política, mas também introduz um modo crítico de falha para a correção fora da política (off-policy) do tipo PPO. Em sistemas de treinamento heterogêneos, a razão de importância total idealmente deve ser decomposta em dois fatores semanticamente distintos: um termo de discrepância entre treino e inferência, que alinha as distribuições do lado da inferência e do lado do treinamento na mesma versão da política comportamental, e um termo de obsolescência da política, que restringe a atualização da política histórica para a política atual. Mostramos que pipelines assíncronos práticos, com atualizações atrasadas e rollouts parciais, frequentemente perdem os logits históricos necessários do lado do treinamento, ou logits antigos. Esse problema de logits antigos ausentes embaralha a correção da discrepância com a correção da obsolescência, quebra a semântica pretendida da correção desacoplada e faz com que os limiares de clipping e mascaramento interajam de maneira indesejável. Para lidar com essa questão, estudamos rotas de correção exatas e aproximadas. Propomos três estratégias exatas de aquisição de logits antigos: rastreamento de versões baseado em snapshots, um modelo dedicado de logits antigos e sincronização via interrupção parcial de rollouts, e comparamos suas compensações sistêmicas. Do ponto de vista da correção aproximada, focamos em preservar os benefícios da correção desacoplada por meio de uma política aproximada mais adequada quando logits antigos exatos não podem ser recuperados a baixo custo, sem incorrer em sobrecarga adicional do sistema. Seguindo essa análise, adotamos um método PPO-EWMA revisado, que obtém ganhos significativos tanto na velocidade de treinamento quanto no desempenho da otimização. Código disponível em: https://github.com/millioniron/ROLL.
English
Asynchronous reinforcement learning improves rollout throughput for large language model agents by decoupling sample generation from policy optimization, but it also introduces a critical failure mode for PPO-style off-policy correction. In heterogeneous training systems, the total importance ratio should ideally be decomposed into two semantically distinct factors: a training--inference discrepancy term that aligns inference-side and training-side distributions at the same behavior-policy version, and a policy-staleness term that constrains the update from the historical policy to the current policy. We show that practical asynchronous pipelines with delayed updates and partial rollouts often lose the required historical training-side logits, or old logits. This missing-old-logit problem entangles discrepancy repair with staleness correction, breaks the intended semantics of decoupled correction, and makes clipping and masking thresholds interact undesirably. To address this issue, we study both exact and approximate correction routes. We propose three exact old-logit acquisition strategies: snapshot-based version tracking, a dedicated old-logit model, and synchronization via partial rollout interruption, and compare their system trade-offs. From the perspective of approximate correction, we focus on preserving the benefits of decoupled correction through a more appropriate approximate policy when exact old logits cannot be recovered at low cost, without incurring extra system overhead. Following this analysis, we adopt a revised PPO-EWMA method, which achieves significant gains in both training speed and optimization performance. Code at https://github.com/millioniron/ROLL.