ChatPaper.aiChatPaper

Transformeren naar hybride aandachtsmodellen

Morphing into Hybrid Attention Models

June 29, 2026
Auteurs: Disen Lan, Jianbin Zheng, Yuxi Ren, Xin Xia, Xuanda Wang, Xuefeng Xiao, Xipeng Qiu, Yu Cheng
cs.AI

Samenvatting

Hybride aandachtsmodellen verbeteren de efficiëntie voor lange contexten door slechts een subset van volledige-aandachtslagen te behouden en de resterende lagen te vervangen door lineaire aandacht. De effectiviteit van de transformatie van Transformer naar hybride hangt echter cruciaal af van welke lagen de volledige aandacht behouden. Bestaande methoden voor het selecteren van hybride lagen vertrouwen doorgaans op heuristische strategieën zoals vaste plaatsingspatronen of laagsgewijze scores, waarbij het laagbelang impliciet als geïsoleerd wordt beschouwd en het onderlinge laageffect onder een globale hybride configuratie over het hoofd wordt gezien. In dit werk formuleren we de selectie van hybride lagen als een budget-beperkt deelverzamelingsoptimalisatieprobleem. Verder stellen we FlashMorph (Fast LAyer Selection for Hybrid MORPHing) voor, een effectieve, efficiënte en schaalbare laagselectiemethode voor de transformatie van Transformer naar hybride. FlashMorph construeert eerst een morfbaar model door elke volledige-aandachtslaag uit te rusten met een omgezette lineaire-aandachtstak. Vervolgens worden alle modelgewichten bevroren en worden laagsgewijze poorten gezamenlijk geoptimaliseerd op synthetische lange-context retrievalsgegevens, met een linearisatieregularisatie die het model aanmoedigt om voor efficiëntie op lineaire aandacht te vertrouwen. De geleerde poorten worden gediscretiseerd onder een vooraf ingesteld volledige-aandachtsbudget om de hybride architectuur te instantiëren, gevolgd door standaard logitsdistillatie en fijnafstemming op lange context. Uitgebreide experimenten tonen aan dat FlashMorph effectievere hybride configuraties ontdekt, een sterke lange-context recall en algemene benchmarkprestaties behoudt, terwijl de kosten voor laagselectie aanzienlijk worden verminderd in vergelijking met bestaande laagselectiemethoden, wat de effectiviteit, efficiëntie en schaalbaarheid ervan aantoont.
English
Hybrid attention models improve long-context efficiency by retaining only a subset of full-attention layers and replacing the remaining layers with linear attention. However, the effectiveness of Transformer-to-hybrid conversion critically depends on which layers preserve full attention. Existing hybrid layer selection methods typically rely on heuristic strategies such as fixed placement patterns or layerwise scoring, implicitly treating layer importance as isolated and overlooking the interdependent layer effect under a global hybrid configuration. In this work, we formulate hybrid layer selection as a budget-constrained subset optimization problem. We further propose FlashMorph (Fast LAyer Selection for Hybrid MORPHing), an effective, efficient and scalable layer selection method for Transformer-to-hybrid conversion. FlashMorph first constructs a morphable model by equipping each full-attention layer with a converted linear-attention branch. It then freezes all model weights and jointly optimizes layerwise gates on synthetic long-context retrieval data, with a linearization regularization that encourages the model to rely on linear attention for efficiency. The learned gates are discretized under a preset full-attention budget to instantiate the hybrid architecture, followed by standard logits distillation and long-context finetuning. Extensive experiments show that FlashMorph discovers more effective hybrid configurations, preserves strong long-context recall and general benchmark performance while substantially reducing layer selection cost compared with existing layer selection methods, demonstrating its effectiveness, efficiency, and scalability.