SEED : Distillation auto-évolutive sur politique pour l'apprentissage par renforcement agentique

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

July 16, 2026
Auteurs: Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao
cs.AI

Résumé

Les grands modèles de langage sont de plus en plus entraînés en tant qu'agents interactifs pour des tâches à long terme impliquant des interactions multi-tours, l'utilisation d'outils et des retours d'environnement. L'apprentissage par renforcement basé sur les résultats (RL) constitue un paradigme d'optimisation pratique, mais ses récompenses parcimonieuses au niveau des trajectoires offrent un guidage limité sur les décisions intermédiaires, créant un écart de supervision entre les résultats au niveau des épisodes et l'apprentissage de politique au niveau des jetons. Nous proposons SEED (SElf-Evolving On-Policy Distillation), un cadre auto-évolutif qui convertit les trajectoires complétées sur politique en compétences rétrospectives pour l'entraînement, et distille leur effet comportemental dans le modèle de politique. SEED ajuste d'abord finement la politique pour analyser les trajectoires complétées et générer des compétences en langage naturel qui capturent des flux de travail réutilisables, des observations décisives ou des règles d'évitement d'échec. Pendant le RL, la politique courante collecte à la fois les trajectoires et sert d'analyseur extrayant les compétences rétrospectives à partir de celles-ci. Les mises à jour de la politique améliorent donc conjointement la prise de décision ultérieure et l'analyse des compétences, permettant à la supervision rétrospective d'évoluer avec la politique. SEED réévalue ensuite les actions échantillonnées dans des contextes ordinaires et augmentés de compétences, convertissant le changement de probabilité induit par les compétences en un signal dense de distillation sur politique au niveau des jetons. Ce signal est optimisé conjointement avec le RL basé sur les résultats, maintenant la supervision auxiliaire alignée avec la distribution courante des trajectoires. Des expériences approfondies sur des tâches agentiques basées sur du texte et des images montrent que SEED améliore constamment les performances et l'efficacité d'échantillonnage, faisant preuve d'une généralisation robuste à des scénarios inconnus. Notre code est disponible à l'adresse https://github.com/jinyangwu/SEED.
English
Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.
PDF661July 18, 2026