ChatPaper.aiChatPaper

TREK : Distiller pour explorer, Renforcer pour affiner

TREK: Distill to Explore, Reinforce to Refine

July 6, 2026
Auteurs: Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz Geramifard
cs.AI

Résumé

L'Optimisation de Politique Relative par Groupe (GRPO) est efficace lorsque la politique courante échantillonne déjà des trajectoires de raisonnement utiles, mais elle stagne sur les prompts difficiles dont les modes de solution corrects se situent en dehors du support on-policy de l'étudiant. Nous proposons TREK (Teacher-Routed Exploration via Forward KL), une procédure simple par étapes qui utilise la distillation non pas pour l'imitation mais pour l'expansion du support d'exploration. Un avantage clé de TREK est sa généralité : comme il ne consomme que des trajectoires de sortie vérifiées, il peut utiliser un enseignant externe en boîte noire, un enseignant en boîte blanche, ou le même modèle avec un contexte de inférence supplémentaire, et il peut identifier efficacement quels échantillons de prompts difficiles valent le plus d'être consolidés, même lorsque les composants internes de l'enseignant sont indisponibles. TREK identifie d'abord les prompts pour lesquels l'étudiant seul a un très faible taux de réussite, interroge une source de propositions pour produire des solutions candidates vérifiées, conserve les r meilleures propositions classées par la vraisemblance actuelle de l'étudiant, applique une courte phase de forward-KL pour intégrer ces modes vérifiés dans le support de l'étudiant, puis revient au raffinement GRPO standard on-policy. En raisonnement mathématique, TREK avec des propositions DeepSeek-V4 améliore les modèles Qwen3 à toutes les échelles testées sur AIME 2024 et AIME 2025 ; pour Qwen3-8B, il améliore AIME 2025 de 36,9 à 40,3 et AIME 2024 de 47,9 à 51,1 (avg@16), tandis que la variante auto-contextuelle atteint 38,5 et 49,6 sans enseignant externe. Sur les tâches agentiques, TREK augmente le taux de réussite d'ALFWorld de 75,8 à 82,8 et celui de ScienceWorld de 12,5 à 26,7 ; notamment, sur les types de tâches les plus difficiles, TREK atteint des taux de réussite élevés tôt dans l'entraînement alors que GRPO non assisté nécessite beaucoup plus d'étapes d'optimisation pour atteindre des niveaux comparables.
English
Group Relative Policy Optimization (GRPO) is effective when the current policy already samples useful reasoning trajectories, but it stalls on hard prompts whose correct solution modes lie outside the student's on-policy support. We propose TREK (Teacher-Routed Exploration via Forward KL), a simple staged procedure that uses distillation not for imitation but for exploration support expansion. A key advantage of TREK is its generality: because it only consumes verified output trajectories, it can use an external black-box teacher, a white-box teacher, or the same model given additional inference-time context, and it can efficiently identify which hard-prompt samples are most worth consolidating even when teacher internals are unavailable. TREK first identifies prompts where the unaided student has very low pass rate, queries a proposal source to produce verified candidate solutions, keeps the top-r proposals ranked by current student likelihood, applies a short forward-KL phase to pull those verified modes into the student's support, and then returns to standard on-policy GRPO refinement. On mathematical reasoning, TREK with DeepSeek-V4 proposals improves Qwen3 models across all tested scales on AIME 2024 and AIME 2025; for Qwen3-8B, it improves AIME 2025 from 36.9 to 40.3 and AIME 2024 from 47.9 to 51.1 (avg@16), while the self-context variant reaches 38.5 and 49.6 without an external teacher. On agentic tasks, TREK raises ALFWorld success rate from 75.8 to 82.8 and ScienceWorld success rate from 12.5 to 26.7; notably, on the hardest task types, TREK achieves high success rates early in training while unaided GRPO requires substantially more optimization steps to reach comparable levels.