Les modèles de génération vidéo comme modèles du monde : paradigmes, architectures et algorithmes efficaces
Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms
March 30, 2026
Auteurs: Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu
cs.AI
Résumé
L'évolution rapide de la génération vidéo a permis aux modèles de simuler des dynamiques physiques complexes et des causalités à long terme, les positionnant comme des simulateurs mondiaux potentiels. Cependant, un écart critique persiste entre la capacité théorique de simulation mondiale et les coûts computationnels élevés de la modélisation spatiotemporelle. Pour y remédier, nous passons en revue de manière exhaustive et systématique les architectures et techniques de génération vidéo qui considèrent l'efficacité comme une exigence cruciale pour une modélisation mondiale pratique. Nous introduisons une nouvelle taxonomie tridimensionnelle : paradigmes de modélisation efficaces, architectures de réseau efficaces et algorithmes d'inférence efficaces. Nous démontrons en outre que combler cet écart d'efficacité habilite directement des applications interactives telles que la conduite autonome, l'IA incarnée et la simulation de jeux. Enfin, nous identifions les nouvelles frontières de recherche dans la modélisation mondiale efficace basée sur la vidéo, en soutenant que l'efficacité est un prérequis fondamental pour faire évoluer les générateurs vidéo en simulateurs mondiaux génériques, en temps réel et robustes.
English
The rapid evolution of video generation has enabled models to simulate complex physical dynamics and long-horizon causalities, positioning them as potential world simulators. However, a critical gap still remains between the theoretical capacity for world simulation and the heavy computational costs of spatiotemporal modeling. To address this, we comprehensively and systematically review video generation frameworks and techniques that consider efficiency as a crucial requirement for practical world modeling. We introduce a novel taxonomy in three dimensions: efficient modeling paradigms, efficient network architectures, and efficient inference algorithms. We further show that bridging this efficiency gap directly empowers interactive applications such as autonomous driving, embodied AI, and game simulation. Finally, we identify emerging research frontiers in efficient video-based world modeling, arguing that efficiency is a fundamental prerequisite for evolving video generators into general-purpose, real-time, and robust world simulators.