SEED: Destilación On-Policy Autoevolutiva para Aprendizaje por Refuerzo Agentivo
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
July 16, 2026
Autores: Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao
cs.AI
Resumen
Los modelos de lenguaje grandes se entrenan cada vez más como agentes interactivos para tareas de horizonte largo que implican interacción de múltiples turnos, uso de herramientas y retroalimentación del entorno. El aprendizaje por refuerzo (RL) basado en resultados proporciona un paradigma de optimización práctico, pero sus recompensas dispersas a nivel de trayectoria ofrecen una guía limitada sobre decisiones intermedias, dejando una brecha de supervisión entre los resultados a nivel de episodio y el aprendizaje de políticas a nivel de tokens. Proponemos SEED (Destilación en Política Autoevolutiva, por sus siglas en inglés), un marco autoevolutivo que convierte las trayectorias completadas en política en habilidades retrospectivas durante el entrenamiento y destila su efecto conductual de vuelta al modelo de política. SEED primero ajusta la política para analizar trayectorias completadas y generar habilidades en lenguaje natural que capturan flujos de trabajo reutilizables, observaciones decisivas o reglas para evitar fallos. Durante el RL, la política actual tanto recopila trayectorias como sirve como analizador que extrae habilidades retrospectivas de ellas. Las actualizaciones de la política mejoran así la toma de decisiones subsiguiente y el análisis de habilidades conjuntamente, permitiendo que la supervisión retrospectiva evolucione con la política. SEED luego re-puntúa las acciones muestreadas en contextos ordinarios y aumentados con habilidades, convirtiendo el cambio de probabilidad inducido por la habilidad en una señal densa de destilación en política a nivel de tokens. Esta señal se optimiza conjuntamente con el RL basado en resultados, manteniendo la supervisión auxiliar alineada con la distribución actual de trayectorias. Experimentos extensos en tareas agentivas basadas en texto y visión muestran que SEED mejora consistentemente el rendimiento y la eficiencia de muestreo, exhibiendo una generalización robusta a escenarios no vistos. Nuestro código está disponible en https://github.com/jinyangwu/SEED.
English
Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.