ChatPaper.aiChatPaper

Exploração por Proxy e Orientação Reutilizável: Um Paradigma Modular de Pós-Treinamento de LLM através de Sinais de Atualização Guiados por Proxy

Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals

July 13, 2026
Autores: Daocheng Fu, Rong Wu, Yu Yang, Xuemeng Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Yong Liu, Botian Shi, Yu Qiao
cs.AI

Resumo

O pós-treinamento é essencial para refinar as capacidades específicas de domínio de modelos de linguagem de grande porte (LLMs), no entanto, os métodos existentes de otimização de recompensa e correspondência de distribuição acoplam firmemente a exploração de políticas ao alinhamento de distribuição. Esse acoplamento força uma exploração dispendiosa diretamente no modelo de política e dificulta severamente a geração assíncrona, a reutilização e a transferência entre modelos de sinais de otimização. Neste artigo, propomos o Proxy-guided Update Signal Transfer (PUST), um novo framework de pós-treinamento que desacopla fundamentalmente a exploração de sinais de atualização do alinhamento de distribuição. Em vez de utilizar o modelo principal para exploração custosa, o PUST emprega um modelo proxy leve como um ambiente de teste eficiente para descobrir comportamentos de alta recompensa. Extraímos o sinal de melhoria relativa entre os estados inicial e otimizado do proxy, transferindo essa atualização direcional para o modelo principal para guiar seu alinhamento de política. Esse pipeline desacoplado, composto por exploração do proxy, extração do sinal de atualização e transferência do sinal, reduz significativamente a sobrecarga computacional e permite que sinais de otimização sejam gerados, armazenados em cache e reutilizados de forma assíncrona. De forma crucial, ao transferir melhorias relativas em vez de distribuições de política absolutas, o PUST suporta naturalmente a melhoria do fraco para o forte e a transferência contínua entre modelos. Avaliações sistemáticas em modelos da família Qwen3 nos domínios de matemática e código demonstram que sinais de atualização extraídos de proxies substancialmente mais fracos podem melhorar de forma robusta e ajustável modelos principais mais fortes. Por fim, o PUST transforma o pós-treinamento de um processo de otimização online monolítico em um paradigma altamente modular, reutilizável e econômico.
English
Post-training is essential for refining the domain-specific capabilities of large language models (LLMs), yet existing reward optimization and distribution matching methods tightly couple policy exploration with distribution alignment. This coupling forces expensive exploration directly on the policy model and severely hinders the asynchronous generation, reuse, and cross-model transfer of optimization signals. In this paper, we propose Proxy-guided Update Signal Transfer (PUST), a novel post-training framework that fundamentally decouples update-signal exploration from distribution alignment. Instead of utilizing the primary model for costly exploration, PUST employs a lightweight proxy model as an efficient testbed to discover high-reward behaviors. We extract the relative improvement signal between the proxy's initial and optimized states, transferring this directional update to the primary model to guide its policy alignment. This decoupled pipeline, comprising proxy exploration, update-signal extraction, and signal transfer, significantly reduces computational overhead and enables optimization signals to be asynchronously generated, cached, and reused. Crucially, by transferring relative improvements rather than absolute policy distributions, PUST naturally supports weak-to-strong improvement and seamless cross-model transfer. Systematic evaluations on Qwen3-family models across math and code domains demonstrate that update signals extracted from substantially weaker proxies can robustly and adjustably enhance stronger primary models. Ultimately, PUST transforms post-training from a monolithic online optimization process into a highly modular, reusable, and cost-efficient paradigm.