BadWAM: Wenn Welt-Aktions-Modelle richtig träumen, aber falsch handeln
BadWAM: When World-Action Models Dream Right but Act Wrong
July 16, 2026
Autoren: Qi Li, Xingyi Yang, Xinchao Wang
cs.AI
Zusammenfassung
Welt-Aktions-Modelle (WAMs) etablieren sich zunehmend als vielversprechende Grundlage für verkörperte Steuerung: Anstatt nur Aktionen vorherzusagen, lernen sie Repräsentationen, die die Aktionsgenerierung mit der zukünftigen Weltvorhersage koppeln. Diese Kopplung wird oft als Quelle von Robustheit, Interpretierbarkeit und Sicherheit betrachtet, da die Aktion eines Roboters im Prinzip anhand seiner imaginierten Zukunft überprüft werden kann. In dieser Arbeit zeigen wir, dass diese Annahme fragil ist. Wir führen BadWAM ein, einen einheitlichen Rahmen zur Modellierung und Bewertung von Welt-Aktions-Drift-Angriffen: eine neue Klasse von WAM-spezifischen adversarialen Angriffen, die kleine visuelle Störungen nutzen, um die Ausrichtung zwischen dem, was ein WAM imaginiert, und dem, was es ausführt, zu brechen. BadWAM charakterisiert diese Angriffsfläche anhand zweier natürlicher Kriterien: Angriffsstärke und Tarnfähigkeit. Wenn der Gegner die Störung priorisiert, instanziiert BadWAM einen rein aktionsbasierten adversarialen Angriff, der das Modell direkt zu aufgabenfehlschlagenden Aktionen treibt. Wenn der Gegner zusätzlich die Tarnung priorisiert, instanziiert BadWAM einen imaginationsbewahrenden adversarialen Angriff, der schädliche Aktionsverschiebungen induzieren soll, während die vom Modell vorhergesagte Zukunft nahe an ihrer sauberen Imagination bleibt. Zusammen erfassen diese beiden Angriffe ein Spektrum WAM-spezifischer Fehler: von offener Aktionsübernahme bis hin zu getarnteren Fällen, in denen das Modell eine plausible Zukunft zu imaginieren scheint, aber eine desynchronisierte Aktion ausführt. Wir evaluieren BadWAM über verschiedene Varianten von WAMs hinweg. Die Ergebnisse zeigen, dass unsere Angriffe die Aufgabenerfolgsraten unter Closed-Loop-Ausführung erheblich reduzieren. Beispielsweise reduziert unser reiner Aktionsangriff die Modellleistung von 96,5 % auf 43,1 % Erfolg. Die Ergebnisse unseres imaginationsbewahrenden Angriffs decken zudem eine WAM-spezifische Schwachstelle auf: Eine moderate zukunftsbewahrende Regularisierung kann eine hohe Angriffsleistung aufrechterhalten, während die Drift der zukünftigen Imagination verringert wird.
English
World-action models (WAMs) are emerging as a promising foundation for embodied control: rather than predicting actions alone, they learn representations that couple action generation with future world prediction. This coupling is often viewed as a source of robustness, interpretability, and safety, as a robot's action can in principle be checked against its imagined future. In this paper, we show that this assumption is fragile. We introduce BadWAM, a unified framework for modeling and evaluating World-Action Drift Attacks: a new class of WAM-specific adversarial attacks that use small visual perturbations to break the alignment between what a WAM imagines and what it executes. BadWAM characterizes this attack surface along two natural criteria: attack strength and stealthiness. When the adversary prioritizes disruption, BadWAM instantiates an action-only adversarial attack, which directly drives the model toward task-failing actions. When the adversary additionally prioritizes stealth, BadWAM instantiates an imagination-preserving adversarial attack, which seeks to induce harmful action shifts while keeping the model's predicted future close to its clean imagination. Together, these two attacks capture a spectrum of WAM-specific failures: from overt action hijacking to stealthier cases where the model appears to imagine a plausible future but executes a desynchronized action. We evaluate BadWAM across different variants of WAMs. Results show that our attacks substantially reduce task success rates under closed-loop execution. For example, our action-only attack reduces the model performance from 96.5% to 43.1% success. The results of our imagination-preserving attack further exposes a WAM-specific vulnerability: moderate future-preserving regularization can maintain strong attack performance while reducing future imagination drift.