SEED: Zelf-evoluerende Beleidsinterne Distillatie voor Agentisch Reinforcement Learning

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

July 16, 2026
Auteurs: Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao
cs.AI

Samenvatting

Grote taalmodellen worden steeds vaker getraind als interactieve agenten voor taken met een lange horizon, waarbij sprake is van interactie met meerdere beurten, toolgebruik en omgevingsfeedback. Op uitkomsten gebaseerd versterkend leren (RL) biedt een praktisch optimalisatieparadigma, maar de schaarse beloningen op trajectniveau geven beperkte sturing voor tussentijdse beslissingen, waardoor er een supervisiekloof ontstaat tussen uitkomsten op episodeniveau en beleidsleren op tokenniveau. Wij stellen SEED (SElf-Evolving On-Policy Distillation) voor, een zelf-evoluerend raamwerk dat voltooide on-policy-trajecten omzet in hindsight-vaardigheden tijdens de training en hun gedragseffect terugdistilleert naar het beleidsmodel. SEED finetunet eerst het beleid om voltooide trajecten te analyseren en natuurlijke-taalvaardigheden te genereren die herbruikbare workflows, beslissende observaties of faalvermijdingsregels vastleggen. Tijdens het RL verzamelt het huidige beleid zowel trajecten als fungeert het als de analyzer die hindsight-vaardigheden uit deze trajecten extraheert. Beleidsupdates verbeteren daardoor zowel het daaropvolgende besluitvormingsproces als de vaardigheidsanalyse, waardoor de hindsight-supervisie met het beleid mee evolueert. Vervolgens herberekent SEED de scores van de bemonsterde acties in gewone en met vaardigheden verrijkte contexten, waarbij de door vaardigheden geïnduceerde kansverschuiving wordt omgezet in een dicht on-policy-distillatiesignaal op tokenniveau. Dit signaal wordt gezamenlijk geoptimaliseerd met het op uitkomsten gebaseerde RL, zodat de aanvullende supervisie blijft aansluiten bij de huidige trajectverdeling. Uitgebreide experimenten op tekstgebaseerde en visiegebaseerde agentische taken tonen aan dat SEED consistent de prestaties en monsterefficiëntie verbetert en robuuste generalisatie vertoont naar ongeziene scenario's. Onze code is beschikbaar op https://github.com/jinyangwu/SEED.
English
Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.
PDF661July 18, 2026