Een enkele laag om ze allemaal te verklaren: Het begrijpen van massieve activaties in grote taalmodellen
A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models
May 8, 2026
Auteurs: Zeru Shi, Zhenting Wang, Fan Yang, Qifan Wang, Ruixiang Tang
cs.AI
Samenvatting
We onderzoeken de oorsprong van massieve activaties in grote taalmodellen (LLM's) en identificeren een specifieke laag, genaamd de Massive Emergence-laag (ME-laag), die consistent wordt waargenomen over modelfamilies heen, waar massieve activaties voor het eerst opduiken en vervolgens via residuele verbindingen naar diepere lagen worden voortgeplant. We tonen aan dat binnen de ME-laag zowel de RMSNorm- als de FFN-parameters gezamenlijk bijdragen aan het ontstaan van massieve activaties. Eenmaal gevormd, blijft de representatie van het massieve activatietoken grotendeels invariant over lagen heen, waardoor de diversiteit van verborgen representaties die naar de aandachtsmodule worden doorgegeven, afneemt. Gemotiveerd door deze beperking stellen we een eenvoudige en effectieve methode voor om de rigiditeit van het massieve activatietoken te verminderen. Onze aanpak verbetert consistent de prestaties van LLM's bij meerdere taken, waaronder instructievolging en wiskundig redeneren, in zowel trainingsvrije als fijnafstemmingsomgevingen. Bovendien tonen we aan dat onze methode attention sinks vermindert door hun invloed selectief te verzwakken, hun oorsprong op het niveau van de verborgen toestand te verduidelijken en nieuw licht te werpen op principiële mitigatiestrategieën.
English
We investigate the origins of massive activations in large language models (LLMs) and identify a specific layer named the Massive Emergence Layer (ME Layer), that is consistently observed across model families, where massive activations first emerge and subsequently propagate to deeper layers through residual connections. We show that, within the ME Layer both the RMSNorm and the FFN parameters jointly contribute to the emergence of massive activations. Once formed, the massive activation token representation remains largely invariant across layers, reducing the diversity of hidden representations passed to the attention module. Motivated by this limitation, we propose a simple and effective method to reduce the rigidity of the massive activation token. Our approach consistently improves LLM performance across multiple tasks, including instruction following and math reasoning, in both training free and fine tuning settings. Moreover, we show that our method mitigates attention sinks by selectively weakening their influence, elucidating their origin at the hidden state level and shedding new light on principled mitigation strategies.