ChatPaper.aiChatPaper

WorldReasonBench : tests de stress alignés sur l'humain des générateurs de vidéo en tant que prédicteurs d'états futurs du monde

WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors

May 11, 2026
Auteurs: Keming Wu, Yijing Cui, Wenhan Xue, Qijie Wang, Xuan Luo, Zhiyuan Feng, Zuhao Yang, Sudong Wang, Sicong Jiang, Haowei Zhu, Zihan Wang, Ping Nie, Wenhu Chen, Bin Wang
cs.AI

Résumé

Les systèmes de génération vidéo commerciaux tels que Seedance 2.0 et Veo 3.1 ont connu des améliorations rapides, renforçant l'idée que les générateurs vidéo pourraient évoluer vers des « simulateurs du monde ». Pourtant, la communauté manque encore d'un benchmark qui teste directement si un modèle peut raisonner sur la manière dont un monde observé devrait évoluer dans le temps. Nous introduisons WorldReasonBench, qui reformule l'évaluation de la génération vidéo comme une prédiction d'état du monde : étant donné un état initial et une action, le modèle peut-il générer une vidéo future dont l'évolution de l'état reste cohérente sur les plans physique, social, logique et informationnel ? WorldReasonBench contient 436 cas de test soigneusement sélectionnés avec des annotations structurées de questions-réponses de vérité terrain couvrant quatre dimensions de raisonnement et 22 sous-catégories. Nous évaluons les vidéos générées à l'aide d'une méthodologie en deux parties alignée sur les jugements humains : la Vérification du raisonnement tenant compte du processus utilise des questions-réponses structurées et des diagnostics de phase de raisonnement pour détecter les échecs temporels et causaux, tandis que l'Évaluation multidimensionnelle de la qualité note la qualité du raisonnement, la cohérence temporelle et l'esthétique visuelle pour le classement et la modélisation par récompense. Nous introduisons également WorldRewardBench, un benchmark de préférences comprenant environ 6 000 paires annotées par des experts sur 1 400 vidéos, prenant en charge l'évaluation de modèles de récompense par paires et par points. Sur l'ensemble des générateurs vidéo modernes, nos résultats révèlent un écart persistant entre la plausibilité visuelle et le raisonnement sur le monde : les vidéos peuvent sembler convaincantes tout en échouant sur la dynamique, la causalité ou la préservation de l'information. Nous publierons nos benchmarks et notre boîte à outils d'évaluation pour soutenir la recherche communautaire sur la génération vidéo véritablement consciente du monde à l'adresse https://github.com/UniX-AI-Lab/WorldReasonBench/.
English
Commercial video generation systems such as Seedance2.0 and Veo3.1 have rapidly improved, strengthening the view that video generators may be evolving into "world simulators." Yet the community still lacks a benchmark that directly tests whether a model can reason about how an observed world should evolve over time. We introduce WorldReasonBench, which reframes video generation evaluation as world-state prediction: given an initial state and an action, can a model generate a future video whose state evolution remains physically, socially, logically, and informationally consistent? WorldReasonBench contains 436 curated test cases with structured ground-truth QA annotations spanning four reasoning dimensions and 22 subcategories. We evaluate generated videos with a human-aligned two-part methodology: Process-aware Reasoning Verification uses structured QA and reasoning-phase diagnostics to detect temporal and causal failures, while Multi-dimensional Quality Assessment scores reasoning quality, temporal consistency, and visual aesthetics for ranking and reward modeling. We further introduce WorldRewardBench, a preference benchmark with approximately 6K expert-annotated pairs over 1.4K videos, supporting pair-wise and point-wise reward-model evaluation. Across modern video generators, our results expose a persistent gap between visual plausibility and world reasoning: videos can look convincing while failing dynamics, causality, or information preservation. We will release our benchmarks and evaluation toolkit to support community research on genuinely world-aware video generation at https://github.com/UniX-AI-Lab/WorldReasonBench/.