SEED: Selbst-evolvierende On-Policy-Destillation für agentisches Reinforcement Learning
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
July 16, 2026
Autoren: Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao
cs.AI
Zusammenfassung
Große Sprachmodelle werden zunehmend als interaktive Agenten für langfristige Aufgaben trainiert, die mehrschrittige Interaktion, Werkzeugnutzung und Umgebungsfeedback umfassen. Ergebnisbasiertes bestärkendes Lernen (RL) bietet ein praktisches Optimierungsparadigma, aber seine spärlichen Belohnungen auf Trajektorienebene bieten nur begrenzte Orientierung für Zwischenentscheidungen, was eine Supervisionslücke zwischen Ergebnissen auf Episodenebene und Policylernen auf Token-Ebene hinterlässt. Wir schlagen SEED (SElf-Evolving On-Policy Distillation) vor, ein selbstevolvierendes Rahmenwerk, das abgeschlossene On-Policy-Trajektorien in während des Trainings gewonnene Rückblickfähigkeiten umwandelt und deren Verhaltenseffekt zurück in das Policymodell destilliert. SEED stimmt zunächst die Policy fein ab, um abgeschlossene Trajektorien zu analysieren und Fähigkeiten in natürlicher Sprache zu generieren, die wiederverwendbare Arbeitsabläufe, entscheidende Beobachtungen oder Fehlervermeidungsregeln erfassen. Während des RL sammelt die aktuelle Policy sowohl Trajektorien als auch dient als Analysator, der Rückblickfähigkeiten aus ihnen extrahiert. Policy-Updates verbessern daher sowohl die nachfolgende Entscheidungsfindung als auch die Fähigkeitsanalyse gemeinsam, sodass sich die Rückblick-Supervision mit der Policy weiterentwickeln kann. SEED bewertet dann die gesampelten Aktionen unter gewöhnlichen und fähigkeitserweiterten Kontexten neu und wandelt die durch Fähigkeiten induzierte Wahrscheinlichkeitsverschiebung in ein dichtes On-Policy-Destillationssignal auf Token-Ebene um. Dieses Signal wird gemeinsam mit dem ergebnisbasierten RL optimiert, wodurch die Hilfs-Supervision mit der aktuellen Trajektorienverteilung abgestimmt bleibt. Umfangreiche Experimente mit textbasierten und visuell basierten agentischen Aufgaben zeigen, dass SEED kontinuierlich die Leistung und Stichprobeneffizienz verbessert und eine robuste Generalisierung auf unbekannte Szenarien aufweist. Unser Code ist verfügbar unter https://github.com/jinyangwu/SEED.
English
Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.