Rumo à compreensão mecanicista de por que o conhecimento memorizado falha em generalizar no ajuste fino de modelos de linguagem de grande porte
Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning
July 9, 2026
Autores: Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong
cs.AI
Resumo
O ajuste fino de LLMs para injetar novo conhecimento enfrenta um desafio crítico: LLMs podem memorizar rapidamente novos fatos, mas falham em usá-los para tarefas de raciocínio downstream. Formalizamos essa falha como a \textbf{Lacuna Conhecer--Usar}, caracterizada por um hiato de precisão e um desfasamento temporal entre memorização e generalização. Para compreender esse fenômeno, ajustamos finamente LLMs com conhecimento não visto e monitoramos a dinâmica espacial de permeação do conhecimento internamente usando uma técnica inovadora de intervenção chamada auto-patching. O auto-patching identifica locais de ativação onde realocar representações melhora substancialmente casos de generalização falhos. Esses resultados são consistentes com uma hipótese de desalinhamento do circuito de conhecimento: representações memorizadas podem existir internamente, mas não ser roteadas para camadas computacionalmente eficazes. Para demonstrar a praticidade dessa descoberta diagnóstica, projetamos uma estratégia heurística simples que recupera 58--75\% da margem de melhoria oracle na falha de generalização. Experimentos são realizados de forma transversal para a robustez dessa descoberta.
English
Fine-tuning LLMs to inject new knowledge faces a critical challenge: LLMs can quickly memorize new facts, yet fail to use them for downstream reasoning tasks. We formalize this failure as the \textbf{Knowing--Using Gap}, characterized by an accuracy gap and a temporal lag between memorization and generalization. To understand this phenomenon, we fine-tune LLMs with unseen knowledge and monitor the spatial permeation dynamics of the knowledge internally using a novel intervention technique called self-patching. Self-patching identifies activation locations where relocating representations substantially improves failed generalization cases. These results are consistent with a knowledge-circuit misalignment hypothesis: memorized representations can exist internally but may not be routed to computation-effective layers. To demonstrate the practicality of this diagnostic finding, we design a simple heuristic strategy which recovers 58--75\% of the oracle headroom in generalization failure. Experiments are done cross-domain for the robustness of this finding.