ChatPaper.aiChatPaper

TREK: Дистилляция для исследования, усиление для уточнения

TREK: Distill to Explore, Reinforce to Refine

July 6, 2026
Авторы: Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz Geramifard
cs.AI

Аннотация

Групповая относительная оптимизация политики (GRPO) эффективна, когда текущая политика уже производит полезные траектории рассуждений, однако она затрудняется на сложных промптах, чьи правильные модальности решений находятся за пределами поддержки студенческой политики внутри политики. Мы предлагаем TREK (Учительская маршрутизация исследования через прямую KL-дивергенцию) — простую поэтапную процедуру, использующую дистилляцию не для имитации, а для расширения поддержки исследования. Ключевое преимущество TREK — его общность: поскольку он использует только верифицированные выходные траектории, он может применять внешнего черноящичного учителя, белоящичного учителя или ту же модель при наличии дополнительного контекста вывода, а также эффективно определять, какие образцы сложных промптов наиболее важны для закрепления, даже когда внутреннее устройство учителя недоступно. TREK сначала идентифицирует промпты, где несопровождаемый студент имеет очень низкий уровень прохождения, запрашивает источник предложений для создания верифицированных кандидатов решений, оставляет топ-r предложений, ранжированных по текущей правдоподобности студента, применяет короткую фазу прямой KL-дивергенции, чтобы втянуть эти верифицированные модальности в поддержку студента, а затем возвращается к стандартной оптимизации GRPO внутри политики. В математических рассуждениях TREK с предложениями DeepSeek-V4 улучшает модели Qwen3 на всех протестированных масштабах на AIME 2024 и AIME 2025; для Qwen3-8B он повышает AIME 2025 с 36,9 до 40,3 и AIME 2024 с 47,9 до 51,1 (avg@16), в то время как вариант с самоконтекстом достигает 38,5 и 49,6 без внешнего учителя. В агентных задачах TREK увеличивает уровень успеха ALFWorld с 75,8 до 82,8 и ScienceWorld с 12,5 до 26,7; примечательно, что на самых сложных типах задач TREK достигает высоких уровней успеха в начале обучения, тогда как несопровождаемый GRPO требует значительно большего количества шагов оптимизации для достижения сопоставимых уровней.
English
Group Relative Policy Optimization (GRPO) is effective when the current policy already samples useful reasoning trajectories, but it stalls on hard prompts whose correct solution modes lie outside the student's on-policy support. We propose TREK (Teacher-Routed Exploration via Forward KL), a simple staged procedure that uses distillation not for imitation but for exploration support expansion. A key advantage of TREK is its generality: because it only consumes verified output trajectories, it can use an external black-box teacher, a white-box teacher, or the same model given additional inference-time context, and it can efficiently identify which hard-prompt samples are most worth consolidating even when teacher internals are unavailable. TREK first identifies prompts where the unaided student has very low pass rate, queries a proposal source to produce verified candidate solutions, keeps the top-r proposals ranked by current student likelihood, applies a short forward-KL phase to pull those verified modes into the student's support, and then returns to standard on-policy GRPO refinement. On mathematical reasoning, TREK with DeepSeek-V4 proposals improves Qwen3 models across all tested scales on AIME 2024 and AIME 2025; for Qwen3-8B, it improves AIME 2025 from 36.9 to 40.3 and AIME 2024 from 47.9 to 51.1 (avg@16), while the self-context variant reaches 38.5 and 49.6 without an external teacher. On agentic tasks, TREK raises ALFWorld success rate from 75.8 to 82.8 and ScienceWorld success rate from 12.5 to 26.7; notably, on the hardest task types, TREK achieves high success rates early in training while unaided GRPO requires substantially more optimization steps to reach comparable levels.