LLM como tutor: Adaptación de prompts consciente de políticas para RL no verificable
LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
July 5, 2026
Autores: Yujin Kim, Namgyu Ho, Sangmin Hwang, Joonkee Kim, Yongjin Yang, Sangmin Bae, Seungone Kim, Jaehun Jung, Se-Young Yun, Hwanjun Song
cs.AI
Resumen
El aprendizaje por refuerzo (RL) para el seguimiento de instrucciones no verificables depende cada vez más de jueces LLM con rúbricas específicas de indicaciones como señales de recompensa. Aunque métodos recientes adaptan estas rúbricas a la política en evolución durante el entrenamiento, las indicaciones de entrenamiento en sí mismas permanecen estáticas, extraídas de corpora fijos. Este enfoque estático a menudo resulta en una desalineación crítica entre la dificultad de la indicación y la capacidad de la política, dejando al juez incapaz de recuperar una señal de recompensa discriminatoria cuando las indicaciones no logran generar variabilidad de calidad entre las ejecuciones. Para abordar esta desalineación, introducimos LLM como Tutor, un marco que extiende el rol del LLM de juez a tutor: un único modelo sirve como examinador que compara por pares las ejecuciones de la política para detectar indicaciones no desafiantes, y como generador que les añade restricciones atómicas. Este diseño de solo añadido aumenta monotónicamente la dificultad al ritmo de la capacidad de la política, produciendo una señal de entrenamiento autocalibrada sin programas de dificultad externos. En tres puntos de referencia complejos de seguimiento de instrucciones, nuestro método supera consistentemente tanto a las líneas base no conscientes de la política como a métodos adaptativos previos que adaptan rúbricas o reescriben indicaciones, sugiriendo que la adaptación de indicaciones constituye un eje faltante de conciencia de la política en el RL no verificable.
English
Reinforcement learning (RL) for non-verifiable instruction following increasingly relies on LLM judges with prompt-specific rubrics as reward signals. While recent methods adapt these rubrics to the evolving policy during training, the training prompts themselves remain static, drawn from fixed corpora. This static approach often results in a critical misalignment between prompt difficulty and policy capability, leaving the judge unable to recover a discriminative reward signal when prompts fail to elicit quality variance among rollouts. To address this misalignment, we introduce LLM-as-a-Tutor, a framework that extends the LLM's role from judge to tutor: a single model serves as an examiner that pairwise-compares policy rollouts to detect non-challenging prompts, and as a generator that appends atomic constraints to them. This append-only design monotonically raises difficulty in step with the policy's capability, producing a self-calibrating training signal without external difficulty schedules. On three complex instruction-following benchmarks, our method consistently outperforms both policy-unaware baselines and prior policy-adaptive methods that adapt rubrics or rewrite prompts, suggesting prompt adaptation as a missing axis of policy-awareness in non-verifiable RL.