ChatPaper.aiChatPaper

Vers une compréhension mécanistique des raisons pour lesquelles les connaissances mémorisées ne parviennent pas à généraliser lors du finetuning des grands modèles de langage.

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

July 9, 2026
Auteurs: Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong
cs.AI

Résumé

Le réglage fin des LLMs pour injecter de nouvelles connaissances pose un défi critique : les LLMs peuvent rapidement mémoriser des faits nouveaux, mais échouent à les utiliser pour des tâches de raisonnement en aval. Nous formalisons cet échec comme \textbf{l'Écart Savoir-Utiliser}, caractérisé par un écart de précision et un décalage temporel entre la mémorisation et la généralisation. Pour comprendre ce phénomène, nous ajustons finement des LLMs avec des connaissances inédites et surveillons la dynamique de perméation spatiale de la connaissance en interne à l'aide d'une technique d'intervention novatrice appelée auto-patch. L'auto-patch identifie les emplacements d'activation où le déplacement des représentations améliore significativement les cas de généralisation échoués. Ces résultats sont cohérents avec une hypothèse de désalignement des circuits de connaissance : les représentations mémorisées peuvent exister en interne mais ne pas être acheminées vers les couches efficaces pour le calcul. Pour démontrer le caractère pratique de cette découverte diagnostique, nous concevons une stratégie heuristique simple qui récupère 58 à 75 % de la marge oracle dans les échecs de généralisation. Les expériences sont réalisées de manière transdomainique pour la robustesse de cette découverte.
English
Fine-tuning LLMs to inject new knowledge faces a critical challenge: LLMs can quickly memorize new facts, yet fail to use them for downstream reasoning tasks. We formalize this failure as the \textbf{Knowing--Using Gap}, characterized by an accuracy gap and a temporal lag between memorization and generalization. To understand this phenomenon, we fine-tune LLMs with unseen knowledge and monitor the spatial permeation dynamics of the knowledge internally using a novel intervention technique called self-patching. Self-patching identifies activation locations where relocating representations substantially improves failed generalization cases. These results are consistent with a knowledge-circuit misalignment hypothesis: memorized representations can exist internally but may not be routed to computation-effective layers. To demonstrate the practicality of this diagnostic finding, we design a simple heuristic strategy which recovers 58--75\% of the oracle headroom in generalization failure. Experiments are done cross-domain for the robustness of this finding.