ChatPaper.aiChatPaper

TREK: Destilar para Explorar, Reforçar para Refinar

TREK: Distill to Explore, Reinforce to Refine

July 6, 2026
Autores: Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz Geramifard
cs.AI

Resumo

A Otimização de Política Relativa a Grupo (GRPO) é eficaz quando a política atual já amostra trajetórias de raciocínio úteis, mas estagna em prompts difíceis cujos modos de solução correta estão fora do suporte dentro da política do estudante. Propomos o TREK (Teacher-Routed Exploration via Forward KL), um procedimento simples em etapas que usa destilação não para imitação, mas para expansão do suporte de exploração. Uma vantagem chave do TREK é sua generalidade: como consome apenas trajetórias de saída verificadas, pode usar um professor externo caixa-preta, um professor caixa-branca ou o mesmo modelo com contexto adicional de inferência, e pode identificar eficientemente quais amostras de prompts difíceis valem mais a pena consolidar mesmo quando os internos do professor não estão disponíveis. O TREK primeiro identifica prompts onde o estudante sem auxílio tem taxa de aprovação muito baixa, consulta uma fonte de propostas para produzir soluções candidatas verificadas, mantém as r melhores propostas classificadas pela verossimilhança atual do estudante, aplica uma breve fase KL direta para trazer esses modos verificados para o suporte do estudante e, em seguida, retorna ao refinamento padrão do GRPO dentro da política. Em raciocínio matemático, o TREK com propostas do DeepSeek-V4 melhora os modelos Qwen3 em todas as escalas testadas no AIME 2024 e AIME 2025; para o Qwen3-8B, melhora o AIME 2025 de 36,9 para 40,3 e o AIME 2024 de 47,9 para 51,1 (avg@16), enquanto a variante de autocontexto atinge 38,5 e 49,6 sem um professor externo. Em tarefas agentivas, o TREK eleva a taxa de sucesso do ALFWorld de 75,8 para 82,8 e a taxa de sucesso do ScienceWorld de 12,5 para 26,7; notavelmente, nos tipos de tarefas mais difíceis, o TREK atinge altas taxas de sucesso no início do treinamento, enquanto o GRPO sem auxílio requer substancialmente mais etapas de otimização para atingir níveis comparáveis.
English
Group Relative Policy Optimization (GRPO) is effective when the current policy already samples useful reasoning trajectories, but it stalls on hard prompts whose correct solution modes lie outside the student's on-policy support. We propose TREK (Teacher-Routed Exploration via Forward KL), a simple staged procedure that uses distillation not for imitation but for exploration support expansion. A key advantage of TREK is its generality: because it only consumes verified output trajectories, it can use an external black-box teacher, a white-box teacher, or the same model given additional inference-time context, and it can efficiently identify which hard-prompt samples are most worth consolidating even when teacher internals are unavailable. TREK first identifies prompts where the unaided student has very low pass rate, queries a proposal source to produce verified candidate solutions, keeps the top-r proposals ranked by current student likelihood, applies a short forward-KL phase to pull those verified modes into the student's support, and then returns to standard on-policy GRPO refinement. On mathematical reasoning, TREK with DeepSeek-V4 proposals improves Qwen3 models across all tested scales on AIME 2024 and AIME 2025; for Qwen3-8B, it improves AIME 2025 from 36.9 to 40.3 and AIME 2024 from 47.9 to 51.1 (avg@16), while the self-context variant reaches 38.5 and 49.6 without an external teacher. On agentic tasks, TREK raises ALFWorld success rate from 75.8 to 82.8 and ScienceWorld success rate from 12.5 to 26.7; notably, on the hardest task types, TREK achieves high success rates early in training while unaided GRPO requires substantially more optimization steps to reach comparable levels.