ChatPaper.aiChatPaper

LLM как репетитор: адаптация промптов с учетом политики для непроверяемого обучения с подкреплением

LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL

July 5, 2026
Авторы: Yujin Kim, Namgyu Ho, Sangmin Hwang, Joonkee Kim, Yongjin Yang, Sangmin Bae, Seungone Kim, Jaehun Jung, Se-Young Yun, Hwanjun Song
cs.AI

Аннотация

Обучение с подкреплением (RL) для следования инструкциям, не подлежащим верификации, всё чаще опирается на LLM-судьи с рубриками, специфичными для промптов, в качестве сигналов вознаграждения. Хотя современные методы адаптируют эти рубрики к изменяющейся политике в процессе обучения, сами обучающие промпты остаются статичными, берясь из фиксированных корпусов. Такой статический подход часто приводит к критическому несоответствию между сложностью промптов и возможностями политики, в результате чего судья не может восстановить дискриминативный сигнал вознаграждения, когда промпты не вызывают различий в качестве среди развёрток. Для устранения этого несоответствия мы представляем LLM-as-a-Tutor — фреймворк, расширяющий роль LLM от судьи до наставника: одна и та же модель выступает как экзаменатор, попарно сравнивающий развёртки политики для выявления невызывающих трудностей промптов, и как генератор, добавляющий к ним атомарные ограничения. Эта конструкция только с добавлением ограничений монотонно повышает сложность синхронно с возможностями политики, создавая самокалибрующийся обучающий сигнал без внешних графиков сложности. На трёх сложных бенчмарках следования инструкциям наш метод последовательно превосходит как базовые методы, не учитывающие политику, так и предшествующие адаптивные к политике методы, адаптирующие рубрики или переписывающие промпты, что указывает на адаптацию промптов как на недостающую ось учёта политики в не подлежащем верификации RL.
English
Reinforcement learning (RL) for non-verifiable instruction following increasingly relies on LLM judges with prompt-specific rubrics as reward signals. While recent methods adapt these rubrics to the evolving policy during training, the training prompts themselves remain static, drawn from fixed corpora. This static approach often results in a critical misalignment between prompt difficulty and policy capability, leaving the judge unable to recover a discriminative reward signal when prompts fail to elicit quality variance among rollouts. To address this misalignment, we introduce LLM-as-a-Tutor, a framework that extends the LLM's role from judge to tutor: a single model serves as an examiner that pairwise-compares policy rollouts to detect non-challenging prompts, and as a generator that appends atomic constraints to them. This append-only design monotonically raises difficulty in step with the policy's capability, producing a self-calibrating training signal without external difficulty schedules. On three complex instruction-following benchmarks, our method consistently outperforms both policy-unaware baselines and prior policy-adaptive methods that adapt rubrics or rewrite prompts, suggesting prompt adaptation as a missing axis of policy-awareness in non-verifiable RL.