LLM als tutor: Beleidsbewuste promptaanpassing voor niet-verifieerbare RL
LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
July 5, 2026
Auteurs: Yujin Kim, Namgyu Ho, Sangmin Hwang, Joonkee Kim, Yongjin Yang, Sangmin Bae, Seungone Kim, Jaehun Jung, Se-Young Yun, Hwanjun Song
cs.AI
Samenvatting
Versterkend leren (RL) voor niet-verifieerbare instructie-opvolging steunt steeds vaker op LLM-beoordelaars met promptspecifieke rubrieken als beloningssignalen. Hoewel recente methoden deze rubrieken tijdens de training aanpassen aan het evoluerende beleid, blijven de trainingsprompts zelf statisch, afkomstig uit vaste corpora. Deze statische aanpak leidt vaak tot een kritieke mismatch tussen promptmoeilijkheid en beleidscompetentie, waardoor de beoordelaar geen discriminerend beloningssignaal kan herstellen wanneer prompts er niet in slagen kwaliteitsvariantie tussen rollouts teweeg te brengen. Om deze mismatch aan te pakken introduceren we LLM-as-a-Tutor, een raamwerk dat de rol van de LLM uitbreidt van beoordelaar naar tutor: één enkel model fungeert zowel als examinator die beleidsrollouts paarsgewijs vergelijkt om niet-uitdagende prompts te detecteren, als als generator die atomaire beperkingen aan deze prompts toevoegt. Dit uitsluitend toevoegende ontwerp verhoogt monotoon de moeilijkheid in stap met de competentie van het beleid, wat leidt tot een zelfkalibrerend trainingssignaal zonder externe moeilijkheidsschema's. Op drie complexe instructie-opvolgingsbenchmarks presteert onze methode consistent beter dan zowel beleidsongevoelige baselines als eerdere beleidsadaptieve methoden die rubrieken aanpassen of prompts herschrijven, wat suggereert dat promptadaptatie een ontbrekende as van beleidsbewustzijn is in niet-verifieerbaar RL.
English
Reinforcement learning (RL) for non-verifiable instruction following increasingly relies on LLM judges with prompt-specific rubrics as reward signals. While recent methods adapt these rubrics to the evolving policy during training, the training prompts themselves remain static, drawn from fixed corpora. This static approach often results in a critical misalignment between prompt difficulty and policy capability, leaving the judge unable to recover a discriminative reward signal when prompts fail to elicit quality variance among rollouts. To address this misalignment, we introduce LLM-as-a-Tutor, a framework that extends the LLM's role from judge to tutor: a single model serves as an examiner that pairwise-compares policy rollouts to detect non-challenging prompts, and as a generator that appends atomic constraints to them. This append-only design monotonically raises difficulty in step with the policy's capability, producing a self-calibrating training signal without external difficulty schedules. On three complex instruction-following benchmarks, our method consistently outperforms both policy-unaware baselines and prior policy-adaptive methods that adapt rubrics or rewrite prompts, suggesting prompt adaptation as a missing axis of policy-awareness in non-verifiable RL.