Étudiant rebelle : Inverser les signaux de l'enseignant pour l'exploration du raisonnement avec RLVR auto-distillé
Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR
May 11, 2026
Auteurs: Jeonghye Kim, Jiwon Jeon, Dongsheng Li, Yuqing Yang
cs.AI
Résumé
L'auto-distillation est devenue un cadre puissant pour le post-entraînement des grands modèles de langage, où un enseignant conditionné par des informations supplémentaires guide un étudiant qui n'en dispose pas, tous deux issus du même modèle. Bien que ce guidage soit utile lorsque l'étudiant échoue, lors de trajectoires réussies, le même mécanisme écrase au contraire les choix de l'étudiant et supprime son propre raisonnement. Par conséquent, nous proposons de lire le signal original d'auto-distillation en sens inverse : lorsque l'étudiant réussit sur un chemin que l'enseignant n'aurait pas prédit, ces jetons reflètent son raisonnement autonome. Sur cette base, nous proposons RLRT (RLVR avec enseignant inversé), qui augmente GRPO en renforçant ces jetons sur les trajectoires correctes. Nous interprétons cela comme une nouvelle forme d'exploration en RLVR : non pas une diversité uniforme, mais une exploration précieuse ancrée dans le propre succès de l'étudiant. Sur les points de contrôle Qwen3 de base, ajustés par instruction et ajustés par réflexion, RLRT surpasse considérablement les lignes de base fondées sur l'auto-distillation et l'exploration, établissant l'asymétrie d'information comme un nouvel axe de conception fondé sur des principes pour RLVR.
English
Self-distillation has emerged as a powerful framework for post-training LLMs, where a teacher conditioned on extra information guides a student without it, both from the same model. While this guidance is useful when the student has failed, on successful rollouts, the same mechanism instead overwrites the student's choices and suppresses it's own reasoning. Therefore, we propose reading the original self-distillation signal in reverse: when the student succeeds along a path the teacher would not have predicted, these tokens reflect its self-driven reasoning. Building on this, we propose RLRT (RLVR with Reversed Teacher), which augments GRPO by reinforcing these tokens on correct rollouts. We interpret this as a new form of exploration in RLVR: not uniform diversity, but valuable exploration grounded in the student's own success. Across base, instruction-tuned, and thinking-tuned Qwen3 checkpoints, RLRT substantially outperforms self-distillation and exploration-based baselines, establishing information asymmetry as a new, principled design axis for RLVR.