Rubriek-gebaseerde on-policy distillatie
Rubric-based On-policy Distillation
May 8, 2026
Auteurs: Junfeng Fang, Zhepei Hong, Mao Zheng, Mingyang Song, Gengsheng Li, Houcheng Jiang, Dan Zhang, Haiyun Guo, Xiang Wang, Tat-Seng Chua
cs.AI
Samenvatting
On-policy distillatie (OPD) is een krachtig paradigma voor modelafstemming, maar de afhankelijkheid van teacher logits beperkt de toepassing ervan tot white-box scenario's. Wij stellen dat gestructureerde semantische rubrieken kunnen dienen als een schaalbaar alternatief voor teacher logits, waardoor OPD mogelijk wordt met alleen door de leraar gegenereerde responsies. Om dit te bewijzen introduceren we ROPD, een eenvoudig maar fundamenteel raamwerk voor op rubrieken gebaseerde OPD. Specifiek induceert ROPD promptspecifieke rubrieken uit leraar-student contrasten, en gebruikt deze rubrieken vervolgens om de student rollouts te scoren voor on-policy optimalisatie. Empirisch gezien presteert ROPD beter dan de geavanceerde op logits gebaseerde OPD-methoden in de meeste scenario's, en behaalt het tot een 10x winst in sample-efficiëntie. Deze resultaten positioneren op rubrieken gebaseerde OPD als een flexibel, black-box-compatibel alternatief voor de gangbare op logits gebaseerde OPD, en bieden een eenvoudige maar sterke baseline voor schaalbare distillatie in propriëtaire en open-source LLMs. Code is beschikbaar op https://github.com/Peregrine123/ROPD_official.
English
On-policy distillation (OPD) is a powerful paradigm for model alignment, yet its reliance on teacher logits restricts its application to white-box scenarios. We contend that structured semantic rubrics can serve as a scalable alternative to teacher logits, enabling OPD using only teacher-generated responses. To prove it, we introduce ROPD, a simple yet foundational framework for rubric-based OPD. Specifically, ROPD induces prompt-specific rubrics from teacher-student contrasts, and then utilizes these rubrics to score the student rollouts for on-policy optimization. Empirically, ROPD outperforms the advanced logit-based OPD methods across most scenarios, and achieving up to a 10x gain in sample efficiency. These results position rubric-based OPD as a flexible, black-box-compatible alternative to the prevailing logit-based OPD, offering a simple yet strong baseline for scalable distillation across proprietary and open-source LLMs. Code is available at https://github.com/Peregrine123/ROPD_official.