Autoencoders Esparsos como Firewalls Plug-and-Play para Detecção de Ataques Adversariais em VLMs
Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs
May 8, 2026
Autores: Hao Wang, Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh, Daisuke Kawahara
cs.AI
Resumo
Os modelos de visão-linguagem (VLMs) avançaram rapidamente e estão cada vez mais implantados em aplicações do mundo real, especialmente com o crescimento dos sistemas baseados em agentes. No entanto, sua segurança tem recebido atenção relativamente limitada. Mesmo os VLMs proprietários e de código aberto mais recentes permanecem altamente vulneráveis a ataques adversariais, expondo aplicações downstream a riscos significativos. Neste trabalho, propomos uma estrutura de detecção de ataques adversariais nova e leve, baseada em autoencoders esparsos (SAEs), denominada SAEgis. Ao inserir um módulo SAE em um VLM pré-treinado e treiná-lo com objetivos de reconstrução padrão, descobrimos que as características latentes esparsas aprendidas capturam naturalmente sinais relevantes para ataques. Essas características permitem classificar de forma confiável se uma imagem de entrada foi perturbada de maneira adversarial, mesmo para amostras nunca antes vistas. Experimentos extensos mostram que o SAEgis alcança desempenho robusto em contextos intra-domínio, entre domínios e entre ataques, com melhorias particularmente grandes na generalização entre domínios em comparação com as bases de referência existentes. Além disso, a combinação de sinais de múltiplas camadas melhora ainda mais a robustez e a estabilidade. Até onde sabemos, este é o primeiro trabalho a explorar SAE como um mecanismo plug-and-play para detecção de ataques adversariais em VLMs. Nosso método não requer treinamento adversarial adicional, introduz uma sobrecarga mínima e fornece uma abordagem prática para melhorar a segurança de sistemas VLM do mundo real.
English
Vision-language models (VLMs) have advanced rapidly and are increasingly deployed in real-world applications, especially with the rise of agent-based systems. However, their safety has received relatively limited attention. Even the latest proprietary and open-weight VLMs remain highly vulnerable to adversarial attacks, leaving downstream applications exposed to significant risks. In this work, we propose a novel and lightweight adversarial attack detection framework based on sparse autoencoders (SAEs), termed SAEgis. By inserting an SAE module into a pretrained VLM and training it with standard reconstruction objectives, we find that the learned sparse latent features naturally capture attack-relevant signals. These features enable reliable classification of whether an input image has been adversarially perturbed, even for previously unseen samples. Extensive experiments show that SAEgis achieves strong performance across in-domain, cross-domain, and cross-attack settings, with particularly large improvements in cross-domain generalization compared to existing baselines. In addition, combining signals from multiple layers further improves robustness and stability. To the best of our knowledge, this is the first work to explore SAE as a plug-and-play mechanism for adversarial attack detection in VLMs. Our method requires no additional adversarial training, introduces minimal overhead, and provides a practical approach for improving the safety of real-world VLM systems.