LLM en tant que tuteur : adaptation de prompts tenant compte de la politique pour le RL non vérifiable
LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
July 5, 2026
Auteurs: Yujin Kim, Namgyu Ho, Sangmin Hwang, Joonkee Kim, Yongjin Yang, Sangmin Bae, Seungone Kim, Jaehun Jung, Se-Young Yun, Hwanjun Song
cs.AI
Résumé
L'apprentissage par renforcement (RL) pour le suivi d'instructions non vérifiables repose de plus en plus sur des juges LLM avec des grilles d'évaluation spécifiques aux prompts comme signaux de récompense. Alors que les méthodes récentes adaptent ces grilles à la politique en évolution pendant l'entraînement, les prompts d'entraînement eux-mêmes restent statiques, issus de corpus fixes. Cette approche statique entraîne souvent un désalignement critique entre la difficulté du prompt et la capacité de la politique, ce qui empêche le juge de récupérer un signal de récompense discriminant lorsque les prompts ne parviennent pas à susciter une variance de qualité parmi les rollouts. Pour remédier à ce désalignement, nous introduisons LLM-as-a-Tutor, un cadre qui étend le rôle du LLM de juge à tuteur : un seul modèle sert d'examinateur qui compare par paires les rollouts de la politique pour détecter les prompts non difficiles, et de générateur qui leur ajoute des contraintes atomiques. Cette conception en appendice uniquement augmente de manière monotone la difficulté en phase avec la capacité de la politique, produisant un signal d'entraînement auto-étalonné sans calendrier de difficulté externe. Sur trois benchmarks complexes de suivi d'instructions, notre méthode surpasse systématiquement à la fois les bases de référence non conscientes de la politique et les méthodes adaptatives antérieures qui adaptent les grilles ou réécrivent les prompts, suggérant que l'adaptation des prompts est un axe manquant de conscience de la politique dans le RL non vérifiable.
English
Reinforcement learning (RL) for non-verifiable instruction following increasingly relies on LLM judges with prompt-specific rubrics as reward signals. While recent methods adapt these rubrics to the evolving policy during training, the training prompts themselves remain static, drawn from fixed corpora. This static approach often results in a critical misalignment between prompt difficulty and policy capability, leaving the judge unable to recover a discriminative reward signal when prompts fail to elicit quality variance among rollouts. To address this misalignment, we introduce LLM-as-a-Tutor, a framework that extends the LLM's role from judge to tutor: a single model serves as an examiner that pairwise-compares policy rollouts to detect non-challenging prompts, and as a generator that appends atomic constraints to them. This append-only design monotonically raises difficulty in step with the policy's capability, producing a self-calibrating training signal without external difficulty schedules. On three complex instruction-following benchmarks, our method consistently outperforms both policy-unaware baselines and prior policy-adaptive methods that adapt rubrics or rewrite prompts, suggesting prompt adaptation as a missing axis of policy-awareness in non-verifiable RL.