ChatPaper.aiChatPaper

WriteSAE : Autoencodeurs parcimonieux pour état récurrent

WriteSAE: Sparse Autoencoders for Recurrent State

May 12, 2026
Auteurs: Jack Young
cs.AI

Résumé

Nous présentons WriteSAE, le premier autoencodeur parcimonieux qui décompose et édite l'écriture du cache matriciel des modèles de langage récurrents hybrides et à espace d'état, là où les SAEs résiduels ne peuvent pas atteindre. Les SAEs existants lisent les flux résiduels, mais Gated DeltaNet, Mamba-2 et RWKV-7 écrivent dans un cache de dimension d_k × d_v via des mises à jour de rang 1 k_t v_t^⊤ qu'aucun atome vectoriel ne peut remplacer. WriteSAE factorise chaque atome du décodeur dans la forme d'écriture native, expose une forme fermée pour le décalage de logit par token, et s'entraîne sous norme de Frobenius appariée, de sorte que les atomes échangent un emplacement de cache à la fois. La substitution d'atomes surpasse l'ablation par norme appariée sur 92,4 % des n = 4 851 déclenchements sur Qwen3.5-0.8B L9 H4, le test de population à 87 atomes se maintient à 89,8 %, la forme fermée prédit les effets mesurés avec R² = 0,98, et Mamba-2-370M substitue à 88,1 % sur 2 500 déclenchements. Des installations soutenues sur trois positions augmentent le midrank target-in-continuation d'un facteur 3, passant de 33,3 % à 100 % sous décodage glouton, ce qui constitue la première installation comportementale sur le site d'écriture matriciel-récurrent.
English
We introduce WriteSAE, the first sparse autoencoder that decomposes and edits the matrix cache write of state-space and hybrid recurrent language models, where residual SAEs cannot reach. Existing SAEs read residual streams, but Gated DeltaNet, Mamba-2, and RWKV-7 write to a d_k times d_v cache through rank-1 updates k_t v_t^top that no vector atom can replace. WriteSAE factors each decoder atom into the native write shape, exposes a closed form for the per-token logit shift, and trains under matched Frobenius norm so atoms swap one cache slot at a time. Atom substitution beats matched-norm ablation on 92.4% of n=4{,}851 firings at Qwen3.5-0.8B L9 H4, the 87-atom population test holds at 89.8%, the closed form predicts measured effects at R^2=0.98, and Mamba-2-370M substitutes at 88.1% over 2,500 firings. Sustained three-position installs at 3times lift midrank target-in-continuation from 33.3% to 100% under greedy decoding, the first behavioral install at the matrix-recurrent write site.