SEED: Distillazione On-Policy Auto-Evolvente per l'Apprendimento per Rinforzo Agentivo

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

July 16, 2026
Autori: Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao
cs.AI

Abstract

I modelli linguistici di grandi dimensioni vengono sempre più spesso addestrati come agenti interattivi per compiti a lungo orizzonte che implicano interazioni a più turni, uso di strumenti e feedback ambientale. L'apprendimento per rinforzo basato sugli esiti (outcome-based reinforcement learning, RL) offre un paradigma di ottimizzazione pratico, ma le sue ricompense sparse a livello di traiettoria forniscono una guida limitata sulle decisioni intermedie, lasciando un vuoto di supervisione tra gli esiti a livello di episodio e l'apprendimento delle politiche a livello di token. Proponiamo SEED (SElf-Evolving On-Policy Distillation), un framework auto-evolutivo che converte le traiettorie complete on-policy in competenze a posteriori (hindsight skills) utilizzabili durante l'addestramento e distilla il loro effetto comportamentale nel modello di politica. SEED prima ottimizza la politica per analizzare le traiettorie complete e generare competenze in linguaggio naturale che catturano flussi di lavoro riutilizzabili, osservazioni decisive o regole di prevenzione degli errori. Durante l'RL, la politica corrente raccoglie sia le traiettorie che funge da analizzatore che estrae da esse le competenze a posteriori. Gli aggiornamenti della politica migliorano quindi sia il processo decisionale successivo che l'analisi delle competenze, consentendo alla supervisione a posteriori di evolversi con la politica. SEED quindi rivaluta le azioni campionate in contesti ordinari e potenziati dalle competenze, convertendo lo spostamento di probabilità indotto dalle competenze in un segnale denso di distillazione on-policy a livello di token. Questo segnale viene ottimizzato congiuntamente con l'RL basato sugli esiti, mantenendo la supervisione ausiliaria allineata con la distribuzione corrente delle traiettorie. Esperimenti approfonditi su compiti agentici basati su testo e su visione mostrano che SEED migliora costantemente le prestazioni e l'efficienza del campionamento, dimostrando una robusta generalizzazione a scenari non visti. Il nostro codice è disponibile all'indirizzo https://github.com/jinyangwu/SEED.
English
Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.
PDF661July 18, 2026