BadWAM: Cuando los modelos mundo-acción sueñan correctamente pero actúan incorrectamente
BadWAM: When World-Action Models Dream Right but Act Wrong
July 16, 2026
Autores: Qi Li, Xingyi Yang, Xinchao Wang
cs.AI
Resumen
Los modelos mundo-acción (WAM, por sus siglas en inglés) están emergiendo como una base prometedora para el control encarnado: en lugar de predecir únicamente acciones, aprenden representaciones que acoplan la generación de acciones con la predicción del mundo futuro. Este acoplamiento suele considerarse una fuente de robustez, interpretabilidad y seguridad, ya que la acción de un robot puede, en principio, verificarse con respecto a su futuro imaginado. En este artículo, mostramos que esta suposición es frágil. Introducimos BadWAM, un marco unificado para modelar y evaluar los ataques de deriva mundo-acción: una nueva clase de ataques adversariales específicos de los WAM que utilizan pequeñas perturbaciones visuales para romper la alineación entre lo que un WAM imagina y lo que ejecuta. BadWAM caracteriza esta superficie de ataque según dos criterios naturales: la fuerza del ataque y su capacidad de pasar desapercibido. Cuando el adversario prioriza la disrupción, BadWAM instancia un ataque adversarial exclusivo de acciones, que impulsa directamente al modelo hacia acciones que conducen al fracaso de la tarea. Cuando el adversario prioriza además el sigilo, BadWAM instancia un ataque adversarial que preserva la imaginación, el cual busca inducir cambios perjudiciales en la acción mientras mantiene el futuro predicho por el modelo cerca de su imaginación limpia. Juntos, estos dos ataques capturan un espectro de fallos específicos de los WAM: desde el secuestro manifiesto de acciones hasta casos más sigilosos donde el modelo parece imaginar un futuro plausible pero ejecuta una acción desincronizada. Evaluamos BadWAM en diferentes variantes de WAM. Los resultados muestran que nuestros ataques reducen sustancialmente las tasas de éxito de la tarea bajo ejecución en lazo cerrado. Por ejemplo, nuestro ataque exclusivo de acciones reduce el rendimiento del modelo de un 96.5 % a un 43.1 % de éxito. Los resultados de nuestro ataque que preserva la imaginación revelan además una vulnerabilidad específica de los WAM: una regularización moderada que preserva el futuro puede mantener un fuerte rendimiento de ataque mientras reduce la deriva de la imaginación futura.
English
World-action models (WAMs) are emerging as a promising foundation for embodied control: rather than predicting actions alone, they learn representations that couple action generation with future world prediction. This coupling is often viewed as a source of robustness, interpretability, and safety, as a robot's action can in principle be checked against its imagined future. In this paper, we show that this assumption is fragile. We introduce BadWAM, a unified framework for modeling and evaluating World-Action Drift Attacks: a new class of WAM-specific adversarial attacks that use small visual perturbations to break the alignment between what a WAM imagines and what it executes. BadWAM characterizes this attack surface along two natural criteria: attack strength and stealthiness. When the adversary prioritizes disruption, BadWAM instantiates an action-only adversarial attack, which directly drives the model toward task-failing actions. When the adversary additionally prioritizes stealth, BadWAM instantiates an imagination-preserving adversarial attack, which seeks to induce harmful action shifts while keeping the model's predicted future close to its clean imagination. Together, these two attacks capture a spectrum of WAM-specific failures: from overt action hijacking to stealthier cases where the model appears to imagine a plausible future but executes a desynchronized action. We evaluate BadWAM across different variants of WAMs. Results show that our attacks substantially reduce task success rates under closed-loop execution. For example, our action-only attack reduces the model performance from 96.5% to 43.1% success. The results of our imagination-preserving attack further exposes a WAM-specific vulnerability: moderate future-preserving regularization can maintain strong attack performance while reducing future imagination drift.