ChatPaper.aiChatPaper

Modelagem Visual Global em Tempo Linear sem Atenção Explícita

Linear-Time Global Visual Modeling without Explicit Attention

May 3, 2026
Autores: Ruize He, Dongchen Han, Gao Huang
cs.AI

Resumo

A pesquisa existente atribui amplamente a capacidade de modelagem de sequência global dos Transformers ao cálculo explícito de pesos de atenção, um processo que inerentemente incorre em complexidade computacional quadrática. Neste trabalho, oferecemos uma nova perspectiva: demonstramos que a atenção pode ser reformulada matematicamente como um Perceptron Multicamadas (MLP) equipado com parâmetros previstos dinamicamente. Através desta lente, explicamos o poder de modelagem global da atenção não como uma agregação explícita entre tokens, mas como um processo implícito onde parâmetros gerados dinamicamente atuam como uma representação comprimida do contexto global. Inspirados por esta percepção, investigamos uma questão fundamental: podemos alcançar uma modelagem global de sequência no nível do Transformer inteiramente através de parametrização dinâmica, mantendo complexidade linear e efetivamente substituindo a atenção explícita? Para explorar isso, projetamos várias estratégias de previsão de parâmetros dinâmicos e as integramos em camadas de rede padrão. Estudos empíricos extensos em modelos de visão demonstram que a parametrização dinâmica pode de fato servir como uma alternativa altamente eficaz e de complexidade linear à atenção explícita, abrindo novos caminhos para a modelagem eficiente de sequências. O código está disponível em https://github.com/LeapLabTHU/WeightFormer.
English
Existing research largely attributes the global sequence modeling capability of Transformers to the explicit computation of attention weights, a process that inherently incurs quadratic computational complexity. In this work, we offer a novel perspective: we demonstrate that attention can be mathematically reframed as a Multi-Layer Perceptron (MLP) equipped with dynamically predicted parameters. Through this lens, we explain attention's global modeling power not as explicit token-wise aggregation, but as an implicit process where dynamically generated parameters act as a compressed representation of the global context. Inspired by this insight, we investigate a fundamental question: can we achieve Transformer-level sequence global modeling entirely through dynamic parameterization while maintaining linear complexity, effectively replacing explicit attention? To explore this, we design various dynamic parameter prediction strategies and integrate them into standard network layers. Extensive empirical studies on vision models demonstrate that dynamic parameterization can indeed serve as a highly effective, linear-complexity alternative to explicit attention, opening new pathways for efficient sequence modeling. Code is available at https://github.com/LeapLabTHU/WeightFormer.