Logit-Contributie Score Identificeert Niet-letterlijke Retrieval Hoofden
Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads
July 1, 2026
Auteurs: Aryo Pradipta Gema, Beatrice Alex, Pasquale Minervini
cs.AI
Samenvatting
Bij gebruik van lange contexten synthetiseren grote taalmodellen vaak antwoorden op basis van de betekenis van een relevante contextspanne, in plaats van deze letterlijk over te nemen. Het identificeren van welke aandachtskoppen deze synthese uitvoeren, is van belang voor het interpreteren van modelgedrag in lange contexten. Toch missen bestaande detectoren deze koppen door hun opzet: ze belonen koppen waarvan het bijgewoonde token overeenkomt met het gegenereerde token, een criterium voor letterlijke kopie dat vastlegt waar een kop leest, maar niet wat hij schrijft via zijn uitvoer-waarde (OV)-circuit, het mechanisme dat juist niet-letterlijke terugwinning mogelijk maakt. We introduceren Logit-Bijdrage Scoren (LOCOS), een schrijf-bewuste detector die elke kop scoort op basis van de projectie van zijn OV-circuit-uitvoer op de onontledingsrichting van het antwoord-token, waarbij naald- en niet-naaldbrongposities in één enkele voorwaartse doorgang worden vergeleken. Over drie modelfamilies (Qwen3, Gemma-3, OLMo-3.1) heen stort het gemiddeld ableren van de top LOCOS-koppen op de NoLiMa niet-letterlijke terugwinningsbenchmark de ROUGE-L bij lagere aantallen koppen in dan eerdere op aandacht gebaseerde detecties; bij Qwen3-8B drijft het ableren van 50 koppen de ROUGE-L van 0,401 naar 0,000, terwijl de sterkste basislijn nog 0,292 behoudt. De geselecteerde koppen zijn terugwinningsspecifiek: parametrische herinnering en rekenkundig redeneren blijven onder dezelfde ablatie op basislijnniveau. Bij Qwen3-8B doet dezelfde ablatie ook MuSiQue dalen van 0,55 naar 0,08 en BABI-Long van 0,62 naar 0,20, terwijl een controle met willekeurige koppen binnen 0,05 van de basislijn blijft.
English
In long-context use, large language models frequently synthesize answers from the meaning of a relevant context span rather than literally copy-pasting them. Identifying which attention heads perform this synthesis matters for interpreting long-context model behavior. Yet existing detectors miss these heads by construction: they reward heads whose attended token matches the generated token, a literal-copy criterion that captures where a head reads but not what it writes through its output-value (OV) circuit, the very mechanism that carries non-literal retrieval. We introduce Logit-Contribution Scoring (LOCOS), a write-aware detector that scores each head by the projection of its OV-circuit output onto the answer-token unembedding direction, contrasting needle and off-needle source positions in a single forward pass. Across three model families (Qwen3, Gemma-3, OLMo-3.1), mean-ablating the top LOCOS heads on the NoLiMa non-literal retrieval benchmark collapses ROUGE-L at lower head counts than prior attention-based detections; on Qwen3-8B, ablating 50 heads drives ROUGE-L from 0.401 to 0.000 while the strongest baseline still retains 0.292. The selected heads are retrieval-specific: parametric recall and arithmetic reasoning stay at baseline under the same ablation. On Qwen3-8B, the same ablation also drops MuSiQue from 0.55 to 0.08 and BABI-Long from 0.62 to 0.20, while a random-heads control stays within 0.05 of baseline.