Exploration par proxy et guidance réutilisable : un paradigme de post-entraînement modulaire pour LLM via des signaux de mise à jour guidés par proxy
Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
July 13, 2026
Auteurs: Daocheng Fu, Rong Wu, Yu Yang, Xuemeng Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Yong Liu, Botian Shi, Yu Qiao
cs.AI
Résumé
Le post-entraînement est essentiel pour affiner les capacités spécifiques à un domaine des grands modèles de langage (LLM), mais les méthodes existantes d'optimisation des récompenses et d'appariement des distributions couplent étroitement l'exploration de la politique avec l'alignement des distributions. Ce couplage impose une exploration coûteuse directement sur le modèle de politique et entrave considérablement la génération asynchrone, la réutilisation et le transfert inter-modèles des signaux d'optimisation. Dans cet article, nous proposons PUST (Proxy-guided Update Signal Transfer), un nouveau cadre de post-entraînement qui dissocie fondamentalement l'exploration des signaux de mise à jour de l'alignement des distributions. Au lieu d'utiliser le modèle principal pour une exploration coûteuse, PUST emploie un modèle proxy léger comme banc d'essai efficace pour découvrir des comportements à haute récompense. Nous extrayons le signal d'amélioration relative entre les états initial et optimisé du proxy, puis transférons cette mise à jour directionnelle au modèle principal pour guider son alignement politique. Ce pipeline découplé, comprenant l'exploration du proxy, l'extraction du signal de mise à jour et le transfert du signal, réduit considérablement le coût computationnel et permet aux signaux d'optimisation d'être générés de manière asynchrone, mis en cache et réutilisés. De manière cruciale, en transférant des améliorations relatives plutôt que des distributions politiques absolues, PUST soutient naturellement l'amélioration du faible au fort et le transfert transparent entre modèles. Des évaluations systématiques sur les modèles de la famille Qwen3 dans les domaines mathématique et du code démontrent que les signaux de mise à jour extraits de proxies considérablement plus faibles peuvent améliorer de manière robuste et ajustable des modèles principaux plus puissants. En fin de compte, PUST transforme le post-entraînement d'un processus d'optimisation monolithique en ligne en un paradigme hautement modulaire, réutilisable et économique.
English
Post-training is essential for refining the domain-specific capabilities of large language models (LLMs), yet existing reward optimization and distribution matching methods tightly couple policy exploration with distribution alignment. This coupling forces expensive exploration directly on the policy model and severely hinders the asynchronous generation, reuse, and cross-model transfer of optimization signals. In this paper, we propose Proxy-guided Update Signal Transfer (PUST), a novel post-training framework that fundamentally decouples update-signal exploration from distribution alignment. Instead of utilizing the primary model for costly exploration, PUST employs a lightweight proxy model as an efficient testbed to discover high-reward behaviors. We extract the relative improvement signal between the proxy's initial and optimized states, transferring this directional update to the primary model to guide its policy alignment. This decoupled pipeline, comprising proxy exploration, update-signal extraction, and signal transfer, significantly reduces computational overhead and enables optimization signals to be asynchronously generated, cached, and reused. Crucially, by transferring relative improvements rather than absolute policy distributions, PUST naturally supports weak-to-strong improvement and seamless cross-model transfer. Systematic evaluations on Qwen3-family models across math and code domains demonstrate that update signals extracted from substantially weaker proxies can robustly and adjustably enhance stronger primary models. Ultimately, PUST transforms post-training from a monolithic online optimization process into a highly modular, reusable, and cost-efficient paradigm.