LLM como Tutor: Adaptação de Prompts Consciente da Política para RL Não Verificável
LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
July 5, 2026
Autores: Yujin Kim, Namgyu Ho, Sangmin Hwang, Joonkee Kim, Yongjin Yang, Sangmin Bae, Seungone Kim, Jaehun Jung, Se-Young Yun, Hwanjun Song
cs.AI
Resumo
Aprendizado por reforço (RL) para seguimento de instruções não verificável depende cada vez mais de juízes LLM com rubricas específicas de prompt como sinais de recompensa. Embora métodos recentes adaptem essas rubricas à política em evolução durante o treinamento, os próprios prompts de treinamento permanecem estáticos, extraídos de corpora fixos. Essa abordagem estática frequentemente resulta em um desalinhamento crítico entre a dificuldade do prompt e a capacidade da política, impedindo que o juiz recupere um sinal de recompensa discriminativo quando os prompts falham em gerar variância de qualidade entre os rollouts. Para lidar com esse desalinhamento, introduzimos o LLM-as-a-Tutor, uma estrutura que estende o papel do LLM de juiz para tutor: um único modelo atua como examinador, que compara em pares os rollouts da política para detectar prompts não desafiadores, e como gerador, que anexa restrições atômicas a esses prompts. Esse design apenas de acréscimo aumenta monotonicamente a dificuldade em sintonia com a capacidade da política, produzindo um sinal de treinamento autocalibrante sem cronogramas externos de dificuldade. Em três benchmarks complexos de seguimento de instruções, nosso método supera consistentemente tanto as linhas de base ignorantes da política quanto os métodos adaptativos anteriores, que adaptam rubricas ou reescrevem prompts, sugerindo que a adaptação de prompts é um eixo ausente de consciência da política em RL não verificável.
English
Reinforcement learning (RL) for non-verifiable instruction following increasingly relies on LLM judges with prompt-specific rubrics as reward signals. While recent methods adapt these rubrics to the evolving policy during training, the training prompts themselves remain static, drawn from fixed corpora. This static approach often results in a critical misalignment between prompt difficulty and policy capability, leaving the judge unable to recover a discriminative reward signal when prompts fail to elicit quality variance among rollouts. To address this misalignment, we introduce LLM-as-a-Tutor, a framework that extends the LLM's role from judge to tutor: a single model serves as an examiner that pairwise-compares policy rollouts to detect non-challenging prompts, and as a generator that appends atomic constraints to them. This append-only design monotonically raises difficulty in step with the policy's capability, producing a self-calibrating training signal without external difficulty schedules. On three complex instruction-following benchmarks, our method consistently outperforms both policy-unaware baselines and prior policy-adaptive methods that adapt rubrics or rewrite prompts, suggesting prompt adaptation as a missing axis of policy-awareness in non-verifiable RL.