La falaise d'extrapolation dans la distillation sur politique de sorties structurées quasi-déterministes
The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs
May 9, 2026
Auteurs: Xin Li, Hao Jiang, Annan Wang, Yichi Zhang, Chau Yuen
cs.AI
Résumé
La distillation sur politique (OPD) est largement utilisée pour le post-entraînement des LLM. Lorsqu'elle est poussée avec un coefficient d'extrapolation de récompense λ > 1, l'étudiant peut dépasser l'enseignant dans le domaine, mais au-delà d'un seuil λ*, la même étape viole le contrat de sortie sur les tâches à sortie structurée. Dans une réduction de Bernoulli à position unique, nous dérivons un seuil de sécurité de clip relatif à la base, sous forme fermée, λ*(p,b,c) déterminé par trois grandeurs mesurables : la probabilité modale de l'enseignant, la masse de démarrage à chaud et la force du clip d'échantillonnage par importance. Au-dessus de λ*, le point fixe extrapolé sort de la zone de sécurité du clip, transformant l'entraînement d'un format préservé à un format effondré. Nous étendons la règle aux tâches JSON listwise calibrées à K classes où une seule classe d'équivalence contraignante domine le contrat de sortie et où le SFT conserve une marge d'analyse syntaxique. Sur Amazon Fashion, trois tests pré-enregistrés (un intervalle de falaise à grille fine, un test d'extension de budget et une prédiction croisée à petit clip) se situent dans leurs fenêtres de prédiction verrouillées, la valeur à petit clip correspondant à la prédiction en forme fermée en dessous de la résolution de grille. En opérant juste en dessous de λ*, ListOPD amène un étudiant Qwen3 de 1,7B à une parité dans le domaine avec une baseline SFT de 8B, avec un cinquième des paramètres. Le gain provient principalement du respect du format : le NDCG@1 sur les sorties analysées reste stable en fonction de λ, tandis que la validité de l'analyse change brusquement à la frontière prédite. Le diagnostic de falaise est indépendant de la rubrique, tandis que l'affirmation de parité utilise une rubrique évaluée par Gemini et hérite de l'exposition de cet évaluateur.
English
On-policy distillation (OPD) is widely used for LLM post-training. When pushed with a reward-extrapolation coefficient lambda > 1, the student can lift past the teacher in domain, but past a threshold lambda* the same step violates the output contract on structured-output tasks. In a single-position Bernoulli reduction, we derive a closed-form base-relative clip-safety threshold lambda*(p,b,c) determined by three measurable quantities: the teacher modal probability, the warm-start mass, and the importance-sampling clip strength. Above lambda*, the extrapolated fixed point exits the clip-safe region, changing training from format-preserving to format-collapsing. We extend the rule to calibrated K-ary listwise JSON tasks where a single binding equivalence class dominates the output contract and SFT retains parse headroom. On Amazon Fashion, three pre-registered tests--a fine-grid cliff interval, a budget-extension test, and a small-clip cross-prediction--fall within their locked prediction windows, with the small-clip value matching the closed-form prediction below grid resolution. Operating just below lambda*, ListOPD brings a 1.7B Qwen3 student to in-domain parity with an 8B-SFT baseline at one-fifth the parameters. The gain is driven primarily by format adherence: NDCG@1 on parsed outputs remains flat across lambda, while parse validity sharply changes at the predicted boundary. The cliff diagnostic is rubric-independent, whereas the parity claim uses a Gemini-graded rubric and inherits that evaluator's exposure.