Прокси-исследование и повторно используемое руководство: модульная парадигма пост-обучения LLM посредством сигналов обновления, направляемых прокси
Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
July 13, 2026
Авторы: Daocheng Fu, Rong Wu, Yu Yang, Xuemeng Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Yong Liu, Botian Shi, Yu Qiao
cs.AI
Аннотация
Пост-обучение является важным этапом для уточнения доменно-специфичных способностей больших языковых моделей (БЯМ), однако существующие методы оптимизации вознаграждения и согласования распределений тесно связывают исследование политики с выравниванием распределений. Такая связь вынуждает проводить дорогостоящее исследование непосредственно на модели политики и серьезно затрудняет асинхронную генерацию, повторное использование и межмодельный перенос сигналов оптимизации. В данной работе мы предлагаем перенос сигналов обновления с помощью прокси-модели (Proxy-guided Update Signal Transfer, PUST) — новую структуру пост-обучения, которая принципиально разделяет исследование сигналов обновления и выравнивание распределений. Вместо использования основной модели для дорогостоящего исследования, PUST применяет легковесную прокси-модель в качестве эффективного испытательного стенда для обнаружения поведений с высоким вознаграждением. Мы извлекаем сигнал относительного улучшения между начальным и оптимизированным состояниями прокси-модели и переносим это направленное обновление на основную модель для направления ее политики. Этот разделенный конвейер, состоящий из исследования прокси-модели, извлечения сигнала обновления и переноса сигнала, значительно снижает вычислительные затраты и позволяет асинхронно генерировать, кэшировать и повторно использовать сигналы оптимизации. Важно, что за счет переноса относительных улучшений, а не абсолютных распределений политики, PUST естественным образом поддерживает улучшение от слабой к сильной модели и бесшовный межмодельный перенос. Систематические оценки на моделях семейства Qwen3 в областях математики и кода демонстрируют, что сигналы обновления, извлеченные из значительно более слабых прокси-моделей, могут надежно и регулируемо улучшать более сильные основные модели. В конечном счете, PUST превращает пост-обучение из монолитного процесса онлайн-оптимизации в высокомодульную, многократно используемую и экономически эффективную парадигму.
English
Post-training is essential for refining the domain-specific capabilities of large language models (LLMs), yet existing reward optimization and distribution matching methods tightly couple policy exploration with distribution alignment. This coupling forces expensive exploration directly on the policy model and severely hinders the asynchronous generation, reuse, and cross-model transfer of optimization signals. In this paper, we propose Proxy-guided Update Signal Transfer (PUST), a novel post-training framework that fundamentally decouples update-signal exploration from distribution alignment. Instead of utilizing the primary model for costly exploration, PUST employs a lightweight proxy model as an efficient testbed to discover high-reward behaviors. We extract the relative improvement signal between the proxy's initial and optimized states, transferring this directional update to the primary model to guide its policy alignment. This decoupled pipeline, comprising proxy exploration, update-signal extraction, and signal transfer, significantly reduces computational overhead and enables optimization signals to be asynchronously generated, cached, and reused. Crucially, by transferring relative improvements rather than absolute policy distributions, PUST naturally supports weak-to-strong improvement and seamless cross-model transfer. Systematic evaluations on Qwen3-family models across math and code domains demonstrate that update signals extracted from substantially weaker proxies can robustly and adjustably enhance stronger primary models. Ultimately, PUST transforms post-training from a monolithic online optimization process into a highly modular, reusable, and cost-efficient paradigm.