L'AUBE des modèles interactifs d'action sur le monde
The DAWN of World-Action Interactive Models
May 12, 2026
Auteurs: Hongbo Lu, Liang Yao, Chenghao He, Haoyu Wang, Xiang Gu, Xianfei Li, Wenlong Liao, Tao He, Pai Peng
cs.AI
Résumé
Une évolution plausible de la scène dépend de la manœuvre considérée, tandis qu'une bonne manœuvre dépend de la manière dont la scène peut évoluer. Les modèles de monde et d'action (WAM) existants négligent largement cette réciprocité, traitant la prédiction du monde et la génération d'actions soit comme des branches parallèles isolées, soit comme des pipelines rigides de type « prédire puis planifier ». Nous formalisons cette perspective sous le nom de modèles interactifs monde-action (WAIM), et l'instancions dans la conduite autonome avec DAWN (Denoising Actions and World iNteractive model), une base générative latente simple mais puissante. DAWN opère dans un espace latent sémantique compact et couple un prédicteur du monde avec un débruitage d'action conditionné par le monde : l'hypothèse prédite du monde conditionne le débruitage de l'action, tandis que l'hypothèse d'action débruitée est renvoyée pour mettre à jour la prédiction du monde, de sorte que les deux sont affinées de manière récursive lors de l'inférence. Plutôt que d'éliminer entièrement l'évolution du monde au moment du test ou de dérouler l'intégralité du futur dans l'espace pixel, DAWN effectue un court déroulement latent explicite suffisant pour soutenir la génération de trajectoires à long horizon dans des scènes interactives complexes. Les expériences montrent que DAWN atteint de bonnes performances de planification et des résultats favorables en matière de sécurité sur plusieurs références de conduite autonome. Plus largement, nos résultats suggèrent que la génération interactive monde-action est une voie fondatrice vers des modèles du monde véritablement actionnables.
English
A plausible scene evolution depends on the maneuver being considered, while a good maneuver depends on how the scene may evolve. Existing World Action Models (WAMs) largely miss this reciprocity, treating world prediction and action generation as either isolated parallel branches or rigid predict-then-plan pipelines. We formalize this perspective as World-Action Interactive Models (WAIMs), and instantiate it in autonomous driving with DAWN (Denoising Actions and World iNteractive model), a simple yet strong latent generative baseline. DAWN operates in a compact semantic latent space and couples a World Predictor with a World-Conditioned Action Denoiser: the predicted world hypothesis conditions action denoising, while the denoised action hypothesis is fed back to update the world prediction, so that both are recursively refined during inference. Rather than eliminating test-time world evolution altogether or rolling out the full future in pixel space, DAWN performs a short explicit latent rollout that is sufficient to support long-horizon trajectory generation in complex interactive scenes. Experiments show that DAWN achieves strong planning performance and favorable safety-related results across multiple autonomous driving benchmarks. More broadly, our results suggest that interactive world-action generation is a principled path toward truly actionable world models.