К механистическому пониманию того, почему заученные знания не обобщаются при тонкой настройке больших языковых моделей
Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning
July 9, 2026
Авторы: Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong
cs.AI
Аннотация
Тонкая настройка больших языковых моделей (LLM) для внедрения новых знаний сталкивается с критической проблемой: LLM могут быстро запоминать новые факты, но не способны использовать их для последующих задач рассуждения. Мы формализуем этот сбой как **разрыв между знанием и использованием**, характеризующийся разрывом в точности и временной задержкой между запоминанием и обобщением. Для понимания этого явления мы настраиваем LLM на неизвестные ранее знания и отслеживаем динамику пространственного проникновения знаний внутри модели с помощью нового метода вмешательства, названного самокоррекцией. Самокоррекция выявляет места активации, где перераспределение представлений существенно улучшает случаи неудачного обобщения. Эти результаты согласуются с гипотезой о несогласованности цепей знаний: запомненные представления могут существовать внутри модели, но не направляться к вычислительно эффективным слоям. Для демонстрации практической значимости данного диагностического вывода мы разрабатываем простую эвристическую стратегию, которая восстанавливает 58–75% эталонного потенциала в случае сбоя обобщения. Эксперименты проводятся в разных областях для проверки устойчивости этого вывода.
English
Fine-tuning LLMs to inject new knowledge faces a critical challenge: LLMs can quickly memorize new facts, yet fail to use them for downstream reasoning tasks. We formalize this failure as the \textbf{Knowing--Using Gap}, characterized by an accuracy gap and a temporal lag between memorization and generalization. To understand this phenomenon, we fine-tune LLMs with unseen knowledge and monitor the spatial permeation dynamics of the knowledge internally using a novel intervention technique called self-patching. Self-patching identifies activation locations where relocating representations substantially improves failed generalization cases. These results are consistent with a knowledge-circuit misalignment hypothesis: memorized representations can exist internally but may not be routed to computation-effective layers. To demonstrate the practicality of this diagnostic finding, we design a simple heuristic strategy which recovers 58--75\% of the oracle headroom in generalization failure. Experiments are done cross-domain for the robustness of this finding.