ChatPaper.aiChatPaper

Sécurité Vision-Langage-Action : Menaces, Défis, Évaluations et Mécanismes

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

April 26, 2026
Auteurs: Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang
cs.AI

Résumé

Les modèles Vision-Langage-Action (VLA) émergent comme un substrat unifié pour l'intelligence incarnée. Ce changement soulève une nouvelle classe de défis de sécurité, découlant de la nature incarnée des systèmes VLA, incluant des conséquences physiques irréversibles, une surface d'attaque multimodale couvrant la vision, le langage et l'état, des contraintes de latence en temps réel pour la défense, la propagation d'erreurs sur des trajectoires à long horizon et des vulnérabilités dans la chaîne d'approvisionnement des données. Pourtant, la littérature reste fragmentée entre l'apprentissage robotique, l'apprentissage automatique adversarial, l'alignement de l'IA et la sécurité des systèmes autonomes. Cette synthèse offre une vue d'ensemble unifiée et actualisée de la sécurité des modèles Vision-Langage-Action. Nous organisons le domaine selon deux axes temporels parallèles : le moment de l'attaque (pendant l'entraînement ou l'inférence) et le moment de la défense (pendant l'entraînement ou l'inférence), en associant chaque classe de menace au stade où elle peut être atténuée. Nous définissons d'abord le périmètre de la sécurité des VLA, en la distinguant de la sécurité des LLM purement textuels et de la sécurité robotique classique, et passons en revue les fondements des modèles VLA, incluant les architectures, les paradigmes d'entraînement et les mécanismes d'inférence. Nous examinons ensuite la littérature à travers quatre prismes : les Attaques, les Défenses, l'Évaluation et le Déploiement. Nous étudions les menaces pendant l'entraînement telles que l'empoisonnement des données et les portes dérobées, ainsi que les attaques pendant l'inférence incluant les patchs adversariaux, les perturbations cross-modales, les contournements sémantiques (jailbreaks) et les attaques par gel (freezing). Nous passons en revue les défenses appliquées pendant l'entraînement et à l'exécution, analysons les benchmarks et métriques existants, et discutons des défis de sécurité dans six domaines de déploiement. Enfin, nous soulignons les problèmes ouverts clés, incluant la robustesse certifiée pour les trajectoires incarnées, les défenses physiquement réalisables, l'entraînement conscient de la sécurité, les architectures de sécurité unifiées à l'exécution et l'évaluation standardisée.
English
Vision-Language-Action (VLA) models are emerging as a unified substrate for embodied intelligence. This shift raises a new class of safety challenges, stemming from the embodied nature of VLA systems, including irreversible physical consequences, a multimodal attack surface across vision, language, and state, real-time latency constraints on defense, error propagation over long-horizon trajectories, and vulnerabilities in the data supply chain. Yet the literature remains fragmented across robotic learning, adversarial machine learning, AI alignment, and autonomous systems safety. This survey provides a unified and up-to-date overview of safety in Vision-Language-Action models. We organize the field along two parallel timing axes, attack timing (training-time vs. inference-time and defense timing (training-time vs. inference-time, linking each class of threat to the stage at which it can be mitigated. We first define the scope of VLA safety, distinguishing it from text-only LLM safety and classical robotic safety, and review the foundations of VLA models, including architectures, training paradigms, and inference mechanisms. We then examine the literature through four lenses: Attacks, Defenses, Evaluation, and Deployment. We survey training-time threats such as data poisoning and backdoors, as well as inference-time attacks including adversarial patches, cross-modal perturbations, semantic jailbreaks, and freezing attacks. We review training-time and runtime defenses, analyze existing benchmarks and metrics, and discuss safety challenges across six deployment domains. Finally, we highlight key open problems, including certified robustness for embodied trajectories, physically realizable defenses, safety-aware training, unified runtime safety architectures, and standardized evaluation.