Hacia la comprensión mecanística de por qué el conocimiento memorizado no logra generalizar en el ajuste fino de modelos de lenguaje grandes
Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning
July 9, 2026
Autores: Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong
cs.AI
Resumen
El ajuste fino de los LLMs para inyectar nuevo conocimiento enfrenta un desafío crítico: los LLMs pueden memorizar rápidamente nuevos hechos, pero no logran utilizarlos para tareas de razonamiento posteriores. Formalizamos este fallo como la \textbf{Brecha de Conocimiento-Uso}, caracterizada por una brecha de precisión y un desfase temporal entre la memorización y la generalización. Para entender este fenómeno, ajustamos finamente los LLMs con conocimiento no visto y monitoreamos las dinámicas de permeación espacial del conocimiento internamente mediante una técnica de intervención novedosa llamada autoparcheo. El autoparcheo identifica ubicaciones de activación donde reubicar representaciones mejora sustancialmente los casos de generalización fallidos. Estos resultados son consistentes con una hipótesis de desalineación del circuito de conocimiento: las representaciones memorizadas pueden existir internamente pero no ser enrutadas a capas computacionalmente efectivas. Para demostrar la practicidad de este hallazgo diagnóstico, diseñamos una estrategia heurística simple que recupera entre el 58 y el 75\% del margen de referencia en el fallo de generalización. Los experimentos se realizan de forma transversal para evaluar la robustez de este hallazgo.
English
Fine-tuning LLMs to inject new knowledge faces a critical challenge: LLMs can quickly memorize new facts, yet fail to use them for downstream reasoning tasks. We formalize this failure as the \textbf{Knowing--Using Gap}, characterized by an accuracy gap and a temporal lag between memorization and generalization. To understand this phenomenon, we fine-tune LLMs with unseen knowledge and monitor the spatial permeation dynamics of the knowledge internally using a novel intervention technique called self-patching. Self-patching identifies activation locations where relocating representations substantially improves failed generalization cases. These results are consistent with a knowledge-circuit misalignment hypothesis: memorized representations can exist internally but may not be routed to computation-effective layers. To demonstrate the practicality of this diagnostic finding, we design a simple heuristic strategy which recovers 58--75\% of the oracle headroom in generalization failure. Experiments are done cross-domain for the robustness of this finding.