Exploración por proxy y guía reutilizable: Un paradigma modular de post-entrenamiento de LLM mediante señales de actualización guiadas por proxy
Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
July 13, 2026
Autores: Daocheng Fu, Rong Wu, Yu Yang, Xuemeng Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Yong Liu, Botian Shi, Yu Qiao
cs.AI
Resumen
Post-entrenamiento es esencial para refinar las capacidades específicas de dominio de los modelos de lenguaje grandes (LLMs), sin embargo, los métodos existentes de optimización de recompensas y emparejamiento de distribuciones acoplan estrechamente la exploración de políticas con la alineación de distribuciones. Este acoplamiento fuerza una exploración costosa directamente en el modelo de políticas y dificulta severamente la generación asíncrona, reutilización y transferencia entre modelos de las señales de optimización. En este artículo, proponemos la Transferencia de Señales de Actualización Guiada por Proxy (PUST, por sus siglas en inglés), un novedoso marco de post-entrenamiento que desacopla fundamentalmente la exploración de señales de actualización de la alineación de distribuciones. En lugar de utilizar el modelo principal para una exploración costosa, PUST emplea un modelo proxy ligero como banco de pruebas eficiente para descubrir comportamientos de alta recompensa. Extraemos la señal de mejora relativa entre el estado inicial y el optimizado del proxy, transfiriendo esta actualización direccional al modelo principal para guiar su alineación de políticas. Este proceso desacoplado, que comprende exploración proxy, extracción de señales de actualización y transferencia de señales, reduce significativamente la carga computacional y permite que las señales de optimización se generen, almacenen en caché y reutilicen de forma asíncrona. De manera crucial, al transferir mejoras relativas en lugar de distribuciones de políticas absolutas, PUST respalda de forma natural la mejora de débil a fuerte y la transferencia fluida entre modelos. Evaluaciones sistemáticas en modelos de la familia Qwen3 en los dominios de matemáticas y código demuestran que las señales de actualización extraídas de proxies sustancialmente más débiles pueden mejorar de manera robusta y ajustable modelos principales más fuertes. En última instancia, PUST transforma el post-entrenamiento de un proceso de optimización en línea monolítico a un paradigma altamente modular, reutilizable y rentable.
English
Post-training is essential for refining the domain-specific capabilities of large language models (LLMs), yet existing reward optimization and distribution matching methods tightly couple policy exploration with distribution alignment. This coupling forces expensive exploration directly on the policy model and severely hinders the asynchronous generation, reuse, and cross-model transfer of optimization signals. In this paper, we propose Proxy-guided Update Signal Transfer (PUST), a novel post-training framework that fundamentally decouples update-signal exploration from distribution alignment. Instead of utilizing the primary model for costly exploration, PUST employs a lightweight proxy model as an efficient testbed to discover high-reward behaviors. We extract the relative improvement signal between the proxy's initial and optimized states, transferring this directional update to the primary model to guide its policy alignment. This decoupled pipeline, comprising proxy exploration, update-signal extraction, and signal transfer, significantly reduces computational overhead and enables optimization signals to be asynchronously generated, cached, and reused. Crucially, by transferring relative improvements rather than absolute policy distributions, PUST naturally supports weak-to-strong improvement and seamless cross-model transfer. Systematic evaluations on Qwen3-family models across math and code domains demonstrate that update signals extracted from substantially weaker proxies can robustly and adjustably enhance stronger primary models. Ultimately, PUST transforms post-training from a monolithic online optimization process into a highly modular, reusable, and cost-efficient paradigm.