BadWAM: Quando i modelli mondo-azione sognano bene ma agiscono male
BadWAM: When World-Action Models Dream Right but Act Wrong
July 16, 2026
Autori: Qi Li, Xingyi Yang, Xinchao Wang
cs.AI
Abstract
I modelli mondo-azione (WAMs) stanno emergendo come una base promettente per il controllo incarnato: invece di prevedere le sole azioni, apprendono rappresentazioni che accoppiano la generazione di azioni con la previsione del mondo futuro. Questo accoppiamento è spesso considerato una fonte di robustezza, interpretabilità e sicurezza, poiché l'azione di un robot può in linea di principio essere verificata rispetto al futuro immaginato. In questo articolo mostriamo che questa assunzione è fragile. Introduciamo BadWAM, un quadro unificato per modellare e valutare gli Attacchi di Deriva Mondo-Azione: una nuova classe di attacchi avversari specifici per WAM che utilizzano piccole perturbazioni visive per rompere l'allineamento tra ciò che un WAM immagina e ciò che esegue. BadWAM caratterizza questa superficie d'attacco secondo due criteri naturali: potenza dell'attacco e furtività. Quando l'avversario dà priorità alla perturbazione, BadWAM istanzia un attacco avversario solo azione, che spinge direttamente il modello verso azioni che portano al fallimento del compito. Quando l'avversario dà priorità anche alla furtività, BadWAM istanzia un attacco avversario che preserva l'immaginazione, che cerca di indurre spostamenti dannosi nelle azioni mantenendo il futuro previsto dal modello vicino alla sua immaginazione pulita. Insieme, questi due attacchi catturano uno spettro di fallimenti specifici dei WAM: dal dirottamento palese delle azioni a casi più subdoli in cui il modello sembra immaginare un futuro plausibile ma esegue un'azione desincronizzata. Valutiamo BadWAM su diverse varianti di WAM. I risultati mostrano che i nostri attacchi riducono sostanzialmente i tassi di successo dei compiti in esecuzione a ciclo chiuso. Ad esempio, il nostro attacco solo azione riduce le prestazioni del modello dal 96,5% al 43,1% di successo. I risultati del nostro attacco che preserva l'immaginazione rivelano inoltre una vulnerabilità specifica dei WAM: una moderata regolarizzazione che preserva il futuro può mantenere elevate prestazioni d'attacco riducendo al contempo la deriva dell'immaginazione futura.
English
World-action models (WAMs) are emerging as a promising foundation for embodied control: rather than predicting actions alone, they learn representations that couple action generation with future world prediction. This coupling is often viewed as a source of robustness, interpretability, and safety, as a robot's action can in principle be checked against its imagined future. In this paper, we show that this assumption is fragile. We introduce BadWAM, a unified framework for modeling and evaluating World-Action Drift Attacks: a new class of WAM-specific adversarial attacks that use small visual perturbations to break the alignment between what a WAM imagines and what it executes. BadWAM characterizes this attack surface along two natural criteria: attack strength and stealthiness. When the adversary prioritizes disruption, BadWAM instantiates an action-only adversarial attack, which directly drives the model toward task-failing actions. When the adversary additionally prioritizes stealth, BadWAM instantiates an imagination-preserving adversarial attack, which seeks to induce harmful action shifts while keeping the model's predicted future close to its clean imagination. Together, these two attacks capture a spectrum of WAM-specific failures: from overt action hijacking to stealthier cases where the model appears to imagine a plausible future but executes a desynchronized action. We evaluate BadWAM across different variants of WAMs. Results show that our attacks substantially reduce task success rates under closed-loop execution. For example, our action-only attack reduces the model performance from 96.5% to 43.1% success. The results of our imagination-preserving attack further exposes a WAM-specific vulnerability: moderate future-preserving regularization can maintain strong attack performance while reducing future imagination drift.