ChatPaper.aiChatPaper

Où l'effondrement de la diversité des sorties se produit-il dans l'apprentissage post-formation ?

Where does output diversity collapse in post-training?

April 17, 2026
Auteurs: Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras
cs.AI

Résumé

Les modèles de langue post-entraînés produisent des sorties moins variées que leurs homologues de base. Cet effondrement de la diversité des sorties compromet les méthodes de mise à l'échelle au moment de l'inférence qui reposent sur des échantillons variés, et risque d'homogénéiser les productions des modèles sur des tâches créatives et chargées de valeurs. Les travaux antérieurs attribuent cet effondrement à des méthodes de post-entraînement spécifiques, sans distinguer le rôle de la composition des données d'entraînement de celui de la méthode, ni le format de génération de celui des poids du modèle. Nous traçons l'évolution de la diversité des sorties à travers trois filières parallèles de post-entraînement d'Olmo 3 : Think (distillation par raisonnement en chaîne), Instruct (données multi-sources étendues) et RL-Zero, sur 15 tâches et quatre métriques de diversité textuelle. Nous constatons que le moment de l'effondrement co-varie avec la composition des données : la filière Think perd la majeure partie de sa diversité sémantique lors du réglage fin supervisé, et l'effet de DPO est plus marqué dans Instruct que dans Think. Supprimer le raisonnement en chaîne lors de l'inférence des modèles Think réduit la précision sur les tâches difficiles, mais laisse inchangée la diversité au niveau des réponses, montrant que l'effondrement est ancré dans les poids du modèle par les données d'entraînement, et non imposé par le format de génération. La décomposition de la perte de diversité sur six tâches vérifiables en une composante de contrôle qualité (élimination des sorties incorrectes) et une composante résiduelle (rétrécissement authentique parmi les sorties correctes) révèle que la répartition dépend de la tâche, et que les modèles Think conservent une plus grande diversité de réponses correctes que les modèles Instruct, malgré un effondrement global plus prononcé. Nos résultats indiquent que l'effondrement de la diversité est déterminé pendant l'entraînement par la composition des données et ne peut être résolu uniquement au moment de l'inférence.
English
Post-trained language models produce less varied outputs than their base counterparts. This output diversity collapse undermines inference-time scaling methods that rely on varied samples, and risks homogenizing model outputs on creative and value-laden tasks. Prior work attributes collapse to specific post-training methods, without separating the role of training data composition from the method, or the generation format from the model weights. We trace output diversity through three parallel post-training lineages of Olmo 3, Think (chain-of-thought distillation), Instruct (broad multi-source data), and RL-Zero, across 15 tasks and four text diversity metrics. We find that the location of collapse co-varies with data composition: the Think lineage loses most semantic diversity at supervised fine-tuning, and the effect of DPO is larger in Instruct than in Think. Suppressing chain-of-thought reasoning at inference in Think models drops accuracy on hard tasks, yet leaves answer-level diversity unchanged, showing that the collapse is embedded in the model weights by training data, not imposed by the generation format. Decomposing diversity loss on six verifiable tasks into a quality-control component (removal of incorrect outputs) and a residual component (genuine narrowing among correct outputs) reveals that the split is task-dependent, and Think models retain more correct-answer diversity than Instruct despite collapsing more in aggregate. Our results indicate that diversity collapse is determined during training by data composition and cannot be addressed at inference time alone.