BadWAM : Quand les modèles monde-action rêvent juste mais agissent mal

BadWAM: When World-Action Models Dream Right but Act Wrong

July 16, 2026
Auteurs: Qi Li, Xingyi Yang, Xinchao Wang
cs.AI

Résumé

Les modèles monde-action (WAM) émergent comme une base prometteuse pour le contrôle incarné : plutôt que de prédire uniquement des actions, ils apprennent des représentations qui couplent la génération d’actions avec la prédiction du monde futur. Ce couplage est souvent perçu comme une source de robustesse, d’interprétabilité et de sécurité, car l’action d’un robot peut en principe être vérifiée par rapport à son futur imaginé. Dans cet article, nous montrons que cette hypothèse est fragile. Nous introduisons BadWAM, un cadre unifié pour modéliser et évaluer les attaques de dérive monde-action : une nouvelle classe d’attaques adverses spécifiques aux WAM qui utilisent de petites perturbations visuelles pour briser l’alignement entre ce qu’un WAM imagine et ce qu’il exécute. BadWAM caractérise cette surface d’attaque selon deux critères naturels : la force d’attaque et la furtivité. Lorsque l’adversaire privilégie la perturbation, BadWAM instancie une attaque adverse uniquement sur l’action, qui conduit directement le modèle vers des actions entraînant l’échec de la tâche. Lorsque l’adversaire privilégie en plus la furtivité, BadWAM instancie une attaque adverse préservant l’imagination, qui cherche à induire des décalages d’actions nuisibles tout en maintenant le futur prédit par le modèle proche de son imagination non perturbée. Ensemble, ces deux attaques capturent un spectre de défaillances propres aux WAM : du détournement d’action flagrant à des cas plus furtifs où le modèle semble imaginer un futur plausible mais exécute une action désynchronisée. Nous évaluons BadWAM sur différentes variantes de WAM. Les résultats montrent que nos attaques réduisent considérablement les taux de réussite des tâches en exécution en boucle fermée. Par exemple, notre attaque uniquement sur l’action réduit la performance du modèle de 96,5 % à 43,1 % de succès. Les résultats de notre attaque préservant l’imagination révèlent en outre une vulnérabilité spécifique aux WAM : une régularisation modérée préservant le futur peut maintenir une forte performance d’attaque tout en réduisant la dérive de l’imagination future.
English
World-action models (WAMs) are emerging as a promising foundation for embodied control: rather than predicting actions alone, they learn representations that couple action generation with future world prediction. This coupling is often viewed as a source of robustness, interpretability, and safety, as a robot's action can in principle be checked against its imagined future. In this paper, we show that this assumption is fragile. We introduce BadWAM, a unified framework for modeling and evaluating World-Action Drift Attacks: a new class of WAM-specific adversarial attacks that use small visual perturbations to break the alignment between what a WAM imagines and what it executes. BadWAM characterizes this attack surface along two natural criteria: attack strength and stealthiness. When the adversary prioritizes disruption, BadWAM instantiates an action-only adversarial attack, which directly drives the model toward task-failing actions. When the adversary additionally prioritizes stealth, BadWAM instantiates an imagination-preserving adversarial attack, which seeks to induce harmful action shifts while keeping the model's predicted future close to its clean imagination. Together, these two attacks capture a spectrum of WAM-specific failures: from overt action hijacking to stealthier cases where the model appears to imagine a plausible future but executes a desynchronized action. We evaluate BadWAM across different variants of WAMs. Results show that our attacks substantially reduce task success rates under closed-loop execution. For example, our action-only attack reduces the model performance from 96.5% to 43.1% success. The results of our imagination-preserving attack further exposes a WAM-specific vulnerability: moderate future-preserving regularization can maintain strong attack performance while reducing future imagination drift.
PDF362July 18, 2026