Pourquoi le réglage fin favorise les hallucinations et comment y remédier
Why Fine-Tuning Encourages Hallucinations and How to Fix It
April 16, 2026
Auteurs: Guy Kaplan, Zorik Gekhman, Zhen Zhu, Lotem Rozner, Yuval Reif, Swabha Swayamdipta, Derek Hoiem, Roy Schwartz
cs.AI
Résumé
Les grands modèles de langage ont tendance à produire des hallucinations sous forme d'énoncés factuellement incorrects. Une source majeure de ces erreurs réside dans l'exposition à de nouvelles informations factuelles lors du réglage fin supervisé (SFT), qui peut amplifier les hallucinations concernant les connaissances acquises pendant le pré-entraînement. Dans ce travail, nous explorons si les hallucinations induites par le SFT peuvent être atténuées à l'aide d'outils établis issus de la littérature sur l'apprentissage continu, puisqu'elles surviennent comme sous-produit de la dégradation des connaissances pendant l'entraînement. Nous proposons une méthode de SFT par auto-distillation qui facilite l'apprentissage factuel efficace tout en minimisant les hallucinations relatives aux connaissances préexistantes, via la régularisation de la dérive de la distribution de sortie. Nous montrons également que, dans des contextes où l'acquisition de nouvelles connaissances n'est pas nécessaire, supprimer la plasticité factuelle en gelant des groupes de paramètres permet de préserver les performances de la tâche tout en réduisant les hallucinations. Enfin, nous étudions le mécanisme sous-jacent aux hallucinations induites par le SFT à travers trois hypothèses : limitations de capacité, clonage comportemental et interférence localisée. Nos expériences démontrent qu'un facteur déterminant est l'interférence entre représentations sémantiques qui se chevauchent, et que l'auto-distillation réussit précisément en atténuant cette interférence.
English
Large language models are prone to hallucinating factually incorrect statements. A key source of these errors is exposure to new factual information through supervised fine-tuning (SFT), which can increase hallucinations w.r.t. knowledge acquired during pre-training. In this work, we explore whether SFT-induced hallucinations can be mitigated using established tools from the continual learning literature, since they arise as a by-product of knowledge degradation during training. We propose a self-distillation-based SFT method that facilitates effective factual learning while minimizing hallucinations w.r.t. pre-existing knowledge by regularizing output-distribution drift. We also show that, in settings where new knowledge acquisition is unnecessary, suppressing factual plasticity by freezing parameter groups, can preserve task performance while reducing hallucinations. Lastly, we investigate the mechanism behind SFT-induced hallucinations through three hypotheses: capacity limitations, behavior cloning, and localized interference. Our experiments show that a main driver is interference among overlapping semantic representations, and that self-distillation succeeds by mitigating this interference.