ChatPaper.aiChatPaper

Estudante Rebelde: Invertendo Sinais do Professor para Exploração de Raciocínio com RLVR Autodestilado

Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR

May 11, 2026
Autores: Jeonghye Kim, Jiwon Jeon, Dongsheng Li, Yuqing Yang
cs.AI

Resumo

A autodestilação emergiu como uma estrutura poderosa para o pós-treinamento de LLMs, na qual um professor condicionado a informações extras orienta um aluno sem elas, ambos provenientes do mesmo modelo. Embora essa orientação seja útil quando o aluno falhou, em rollouts bem-sucedidos, o mesmo mecanismo, em vez disso, sobrescreve as escolhas do aluno e suprime seu próprio raciocínio. Portanto, propomos ler o sinal original da autodestilação ao contrário: quando o aluno tem sucesso ao longo de um caminho que o professor não teria previsto, esses tokens refletem seu raciocínio autônomo. Com base nisso, propomos RLRT (RLVR com Professor Reverso), que amplia o GRPO ao reforçar esses tokens em rollouts corretos. Interpretamos isso como uma nova forma de exploração em RLVR: não diversidade uniforme, mas exploração valiosa fundamentada no próprio sucesso do aluno. Entre checkpoints Qwen3 base, ajustados por instruções e ajustados para pensamento, o RLRT supera substancialmente as linhas de base baseadas em autodestilação e exploração, estabelecendo a assimetria de informação como um novo eixo de design baseado em princípios para RLVR.
English
Self-distillation has emerged as a powerful framework for post-training LLMs, where a teacher conditioned on extra information guides a student without it, both from the same model. While this guidance is useful when the student has failed, on successful rollouts, the same mechanism instead overwrites the student's choices and suppresses it's own reasoning. Therefore, we propose reading the original self-distillation signal in reverse: when the student succeeds along a path the teacher would not have predicted, these tokens reflect its self-driven reasoning. Building on this, we propose RLRT (RLVR with Reversed Teacher), which augments GRPO by reinforcing these tokens on correct rollouts. We interpret this as a new form of exploration in RLVR: not uniform diversity, but valuable exploration grounded in the student's own success. Across base, instruction-tuned, and thinking-tuned Qwen3 checkpoints, RLRT substantially outperforms self-distillation and exploration-based baselines, establishing information asymmetry as a new, principled design axis for RLVR.