SEED: Самоэволюционирующая дистилляция на основе текущей политики для агентного обучения с подкреплением
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
July 16, 2026
Авторы: Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao
cs.AI
Аннотация
Большие языковые модели всё чаще обучаются как интерактивные агенты для долгосрочных задач, предполагающих многошаговое взаимодействие, использование инструментов и обратную связь от среды. Обучение с подкреплением (RL) на основе результатов предоставляет практическую парадигму оптимизации, однако её разреженные вознаграждения на уровне траекторий дают ограниченные указания для промежуточных решений, создавая разрыв в контроле между результатами эпизодов и обучением политики на уровне токенов. Мы предлагаем SEED (Self-Evolving On-Policy Distillation) — саморазвивающуюся структуру, которая преобразует завершённые он-политические траектории в ретроспективные навыки на этапе обучения и дистиллирует их поведенческий эффект обратно в модель политики. SEED сначала дообучает политику для анализа завершённых траекторий и генерации навыков на естественном языке, фиксирующих повторно используемые рабочие процессы, ключевые наблюдения или правила предотвращения ошибок. Во время RL текущая политика одновременно собирает траектории и выступает в роли анализатора, извлекающего из этих траекторий ретроспективные навыки. Таким образом, обновления политики улучшают как последующие решения, так и анализ навыков, позволяя ретроспективному контролю развиваться вместе с политикой. Затем SEED повторно оценивает выбранные действия в обычном и дополненном навыками контекстах, преобразуя сдвиг вероятностей, вызванный навыками, в плотный он-политический сигнал дистилляции на уровне токенов. Этот сигнал оптимизируется совместно с RL на основе результатов, что позволяет вспомогательному контролю оставаться согласованным с текущим распределением траекторий. Обширные эксперименты на текстовых и визуальных агентных задачах показывают, что SEED последовательно улучшает производительность и эффективность использования выборок, демонстрируя устойчивое обобщение на невиданные сценарии. Наш код доступен по адресу https://github.com/jinyangwu/SEED.
English
Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.