ChatPaper.aiChatPaper

TREK: Destilar para Explorar, Reforzar para Refinar

TREK: Distill to Explore, Reinforce to Refine

July 6, 2026
Autores: Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz Geramifard
cs.AI

Resumen

La Optimización Relativa de Políticas por Grupo (GRPO) resulta efectiva cuando la política actual ya muestrea trayectorias de razonamiento útiles, pero se estanca en instrucciones difíciles cuyos modos de solución correctos se encuentran fuera del soporte on-policy del estudiante. Proponemos TREK (Exploración Guiada por el Profesor mediante KL Directa), un procedimiento simple por etapas que utiliza destilación no para imitación, sino para expandir el soporte de exploración. Una ventaja clave de TREK es su generalidad: dado que solo consume trayectorias de salida verificadas, puede emplear un profesor externo de caja negra, un profesor de caja blanca o el mismo modelo con contexto adicional en tiempo de inferencia, y puede identificar eficientemente qué muestras de instrucciones difíciles son más valiosas de consolidar incluso cuando los componentes internos del profesor no están disponibles. TREK primero identifica las instrucciones donde el estudiante sin ayuda tiene una tasa de éxito muy baja, consulta una fuente de propuestas para generar soluciones candidatas verificadas, conserva las mejores \(r\) propuestas según la verosimilitud actual del estudiante, aplica una fase corta de KL directa para incorporar esos modos verificados al soporte del estudiante, y luego retorna al refinamiento estándar con GRPO on-policy. En razonamiento matemático, TREK con propuestas de DeepSeek-V4 mejora los modelos Qwen3 en todas las escalas evaluadas en AIME 2024 y AIME 2025; para Qwen3-8B, mejora AIME 2025 de 36.9 a 40.3 y AIME 2024 de 47.9 a 51.1 (avg@16), mientras que la variante con contexto propio alcanza 38.5 y 49.6 sin un profesor externo. En tareas agénticas, TREK eleva la tasa de éxito en ALFWorld de 75.8 a 82.8 y en ScienceWorld de 12.5 a 26.7; notablemente, en los tipos de tarea más difíciles, TREK logra altas tasas de éxito temprano en el entrenamiento, mientras que GRPO sin ayuda requiere sustancialmente más pasos de optimización para alcanzar niveles comparables.
English
Group Relative Policy Optimization (GRPO) is effective when the current policy already samples useful reasoning trajectories, but it stalls on hard prompts whose correct solution modes lie outside the student's on-policy support. We propose TREK (Teacher-Routed Exploration via Forward KL), a simple staged procedure that uses distillation not for imitation but for exploration support expansion. A key advantage of TREK is its generality: because it only consumes verified output trajectories, it can use an external black-box teacher, a white-box teacher, or the same model given additional inference-time context, and it can efficiently identify which hard-prompt samples are most worth consolidating even when teacher internals are unavailable. TREK first identifies prompts where the unaided student has very low pass rate, queries a proposal source to produce verified candidate solutions, keeps the top-r proposals ranked by current student likelihood, applies a short forward-KL phase to pull those verified modes into the student's support, and then returns to standard on-policy GRPO refinement. On mathematical reasoning, TREK with DeepSeek-V4 proposals improves Qwen3 models across all tested scales on AIME 2024 and AIME 2025; for Qwen3-8B, it improves AIME 2025 from 36.9 to 40.3 and AIME 2024 from 47.9 to 51.1 (avg@16), while the self-context variant reaches 38.5 and 49.6 without an external teacher. On agentic tasks, TREK raises ALFWorld success rate from 75.8 to 82.8 and ScienceWorld success rate from 12.5 to 26.7; notably, on the hardest task types, TREK achieves high success rates early in training while unaided GRPO requires substantially more optimization steps to reach comparable levels.