Atenção Esparsa Simplificada via Tokens de Essência
Simplified Sparse Attention via Gist Tokens
June 26, 2026
Autores: Yuzhen Mao, Michael Y. Li, Emily B. Fox
cs.AI
Resumo
A atenção esparsa pode reduzir o custo da inferência em contextos longos, mas a maioria das variantes introduz novos componentes arquitetônicos. Apresentamos a Atenção Esparsa Simplificada (SSA), uma abordagem mais simples para atenção esparsa que não exige alterações arquitetônicas. Concretamente, primeiro realizamos pré-treinamento continuado em sequências intercaladas com tokens de essência. Otimizamos a perda padrão de próximo token como de costume, mas os tokens de essência utilizam uma máscara de atenção para restringir a quais partes do contexto o modelo de linguagem pode atender; isso ensina o modelo a compactar as informações importantes de cada bloco nos tokens de essência. No momento da inferência, o SSA pontua blocos por meio da atenção entre a consulta atual e o pequeno conjunto de tokens de essência, expandindo seletivamente os k blocos principais ao reintroduzir seus tokens brutos correspondentes. Como a consulta é pontuada apenas contra os tokens de essência, evitamos o custo de largura de banda de memória associado à pontuação ingênua contra o cache KV completo, sem exigir a abordagem de cache KV auxiliar utilizada por métodos de atenção esparsa. No LongBench, o SSA supera consistentemente as linhas de base de compressão e atenção esparsa em tempo de inferência sob a mesma taxa de compressão. Mais notavelmente, na geração aumentada por recuperação, o SSA pode até superar a atenção completa após o pré-treinamento continuado em mais de 5,7 pontos. Atribuímos isso à capacidade de expansão seletiva do SSA, que concentra a atenção nos blocos relevantes para a consulta e filtra efetivamente o ruído. O SSA se estende ainda a uma variante hierárquica de essência-da-essência (H-SSA) que alcança complexidade de decodificação log-linear enquanto mantém ou melhora a precisão em altas taxas de compressão de até 32x. O código está disponível em https://github.com/yuzhenmao/simplified-sparse-attention/.
English
Sparse attention can reduce the cost of long-context inference, but most variants introduce new architectural components. We introduce Simplified Sparse Attention (SSA), a simpler approach to sparse attention that requires no architectural changes. Concretely, we first perform continued pretraining on sequences interleaved with gist tokens. We optimize the standard next-token loss as usual, but the gist tokens use an attention mask to restrict what parts of the context the language model can attend to; this teaches the model to pack each chunk's important information into the gist tokens. At inference time, SSA scores chunks via attention between the current query and the small set of gist tokens, selectively unfolding the top-k chunks by reintroducing their corresponding raw tokens. Since the query is scored only against the gist tokens, we avoid the memory-bandwidth cost associated with naive scoring against the full KV cache, without requiring the auxiliary KV cache approach used by sparse attention methods. On LongBench, SSA consistently outperforms compression and inference-time sparse-attention baselines under the same compression ratio. More strikingly, in retrieval-augmented generation, SSA can even outperform full attention after continued pretraining by over 5.7 points. We attribute this to the ability of SSA's selective unfolding, which concentrates attention on the query-relevant chunks and effectively filters out noise. SSA further extends to a hierarchical gist-of-gist variant (H-SSA) that achieves log-linear decoding complexity while maintaining or improving accuracy at high compression ratios up to 32x. The code is available at https://github.com/yuzhenmao/simplified-sparse-attention/.