BadWAM: Когда модели «мир-действие» правильно мечтают, но ошибаются в действиях

BadWAM: When World-Action Models Dream Right but Act Wrong

July 16, 2026
Авторы: Qi Li, Xingyi Yang, Xinchao Wang
cs.AI

Аннотация

Модели мира-действия (World-Action Models, WAM) становятся перспективной основой для воплощенного управления: вместо прогнозирования только действий они обучают представления, связывающие генерацию действий с прогнозированием будущего мира. Эта связь часто рассматривается как источник устойчивости, интерпретируемости и безопасности, поскольку действие робота в принципе можно проверить на соответствие его воображаемому будущему. В данной работе мы показываем, что это предположение является хрупким. Мы представляем BadWAM — единую среду для моделирования и оценки атак дрейфа мира-действия (World-Action Drift Attacks): нового класса состязательных атак, специфичных для WAM, которые используют малые визуальные возмущения для нарушения согласованности между тем, что WAM воображает, и тем, что она выполняет. BadWAM характеризует эту поверхность атаки по двум естественным критериям: сила атаки и скрытность. Когда противник отдает приоритет нарушению, BadWAM реализует состязательную атаку только на действия, которая напрямую подталкивает модель к действиям, ведущим к сбою задачи. Когда противник дополнительно отдает приоритет скрытности, BadWAM реализует состязательную атаку с сохранением воображения, которая стремится вызвать вредные сдвиги действий, удерживая прогнозируемое моделью будущее близким к ее чистому воображению. Вместе эти две атаки охватывают спектр сбоев, специфичных для WAM: от явного перехвата действий до более скрытных случаев, когда модель, по-видимому, воображает правдоподобное будущее, но выполняет десинхронизированное действие. Мы оцениваем BadWAM на различных вариантах WAM. Результаты показывают, что наши атаки существенно снижают показатели успешности выполнения задач в замкнутом цикле. Например, наша атака только на действия снижает производительность модели с 96,5% до 43,1% успешных попыток. Результаты атаки с сохранением воображения дополнительно выявляют уязвимость, специфичную для WAM: умеренная регуляризация сохранения будущего может поддерживать высокую эффективность атаки, уменьшая при этом дрейф воображения будущего.
English
World-action models (WAMs) are emerging as a promising foundation for embodied control: rather than predicting actions alone, they learn representations that couple action generation with future world prediction. This coupling is often viewed as a source of robustness, interpretability, and safety, as a robot's action can in principle be checked against its imagined future. In this paper, we show that this assumption is fragile. We introduce BadWAM, a unified framework for modeling and evaluating World-Action Drift Attacks: a new class of WAM-specific adversarial attacks that use small visual perturbations to break the alignment between what a WAM imagines and what it executes. BadWAM characterizes this attack surface along two natural criteria: attack strength and stealthiness. When the adversary prioritizes disruption, BadWAM instantiates an action-only adversarial attack, which directly drives the model toward task-failing actions. When the adversary additionally prioritizes stealth, BadWAM instantiates an imagination-preserving adversarial attack, which seeks to induce harmful action shifts while keeping the model's predicted future close to its clean imagination. Together, these two attacks capture a spectrum of WAM-specific failures: from overt action hijacking to stealthier cases where the model appears to imagine a plausible future but executes a desynchronized action. We evaluate BadWAM across different variants of WAMs. Results show that our attacks substantially reduce task success rates under closed-loop execution. For example, our action-only attack reduces the model performance from 96.5% to 43.1% success. The results of our imagination-preserving attack further exposes a WAM-specific vulnerability: moderate future-preserving regularization can maintain strong attack performance while reducing future imagination drift.
PDF362July 18, 2026