ChatPaper.aiChatPaper

Proxy-exploratie en herbruikbare begeleiding: een modulair LLM-posttrainingparadigma via proxy-gestuurde updatesignalen

Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals

July 13, 2026
Auteurs: Daocheng Fu, Rong Wu, Yu Yang, Xuemeng Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Yong Liu, Botian Shi, Yu Qiao
cs.AI

Samenvatting

Nabewerking is essentieel voor het verfijnen van de domeinspecifieke capaciteiten van grote taalmodellen (LLM's), maar bestaande methoden voor beloningsoptimalisatie en distributiematching koppelen beleidsverkenning strak aan distributie-afstemming. Deze koppeling dwingt dure exploratie direct op het beleidsmodel af en belemmert ernstig de asynchrone generatie, het hergebruik en de cross-model overdracht van optimalisatiesignalen. In dit artikel stellen we Proxy-guided Update Signal Transfer (PUST) voor, een nieuw nabewerkingsraamwerk dat update-signaalexploratie fundamenteel ontkoppelt van distributie-afstemming. In plaats van het primaire model te gebruiken voor dure exploratie, zet PUST een lichtgewicht proxymodel in als een efficiënte testomgeving om gedragingen met hoge beloningen te ontdekken. We extraheren het relatieve verbeteringssignaal tussen de initiële en geoptimaliseerde toestand van de proxy en dragen deze directionele update over naar het primaire model om diens beleidsafstemming te sturen. Deze ontkoppelde pijplijn, bestaande uit proxy-exploratie, update-signaalextractie en signaaloverdracht, vermindert de computationele overhead aanzienlijk en maakt het mogelijk dat optimalisatiesignalen asynchroon worden gegenereerd, gecachet en hergebruikt. Cruciaal is dat PUST, door relatieve verbeteringen over te dragen in plaats van absolute beleidsdistributies, van nature zwak-naar-sterk verbetering en naadloze cross-model overdracht ondersteunt. Systematische evaluaties op modellen uit de Qwen3-familie op het gebied van wiskunde en code tonen aan dat updatesignalen die zijn geëxtraheerd uit aanzienlijk zwakkere proxy's robuust en aanpasbaar sterkere primaire modellen kunnen verbeteren. Uiteindelijk transformeert PUST nabewerking van een monolithisch online optimalisatieproces naar een zeer modulair, herbruikbaar en kostenefficiënt paradigma.
English
Post-training is essential for refining the domain-specific capabilities of large language models (LLMs), yet existing reward optimization and distribution matching methods tightly couple policy exploration with distribution alignment. This coupling forces expensive exploration directly on the policy model and severely hinders the asynchronous generation, reuse, and cross-model transfer of optimization signals. In this paper, we propose Proxy-guided Update Signal Transfer (PUST), a novel post-training framework that fundamentally decouples update-signal exploration from distribution alignment. Instead of utilizing the primary model for costly exploration, PUST employs a lightweight proxy model as an efficient testbed to discover high-reward behaviors. We extract the relative improvement signal between the proxy's initial and optimized states, transferring this directional update to the primary model to guide its policy alignment. This decoupled pipeline, comprising proxy exploration, update-signal extraction, and signal transfer, significantly reduces computational overhead and enables optimization signals to be asynchronously generated, cached, and reused. Crucially, by transferring relative improvements rather than absolute policy distributions, PUST naturally supports weak-to-strong improvement and seamless cross-model transfer. Systematic evaluations on Qwen3-family models across math and code domains demonstrate that update signals extracted from substantially weaker proxies can robustly and adjustably enhance stronger primary models. Ultimately, PUST transforms post-training from a monolithic online optimization process into a highly modular, reusable, and cost-efficient paradigm.