WorldReasonBench: Mensgerichte Stresstesten van Videogeneratoren als Voorspellers van Toekomstige Wereldtoestanden
WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors
May 11, 2026
Auteurs: Keming Wu, Yijing Cui, Wenhan Xue, Qijie Wang, Xuan Luo, Zhiyuan Feng, Zuhao Yang, Sudong Wang, Sicong Jiang, Haowei Zhu, Zihan Wang, Ping Nie, Wenhu Chen, Bin Wang
cs.AI
Samenvatting
Commerciële videogeneratiesystemen zoals Seedance2.0 en Veo3.1 zijn snel verbeterd, wat de opvatting versterkt dat videogeneratoren zich mogelijk ontwikkelen tot 'wereldsimulators'. Toch ontbreekt het de onderzoeksgemeenschap nog aan een benchmark die rechtstreeks toetst of een model kan redeneren over hoe een waargenomen wereld in de loop van de tijd zou moeten evolueren. We introduceren WorldReasonBench, die de evaluatie van videogeneratie herformuleert als voorspelling van wereldtoestanden: gegeven een begintoestand en een actie, kan een model een toekomstige video genereren waarvan de toestandsevolutie fysiek, sociaal, logisch en informatieel consistent blijft? WorldReasonBench bevat 436 samengestelde testgevallen met gestructureerde grondwaarheid QA-annotaties die vier redeneerdimensies en 22 subcategorieën beslaan. We evalueren gegenereerde video's met een twee-delige methodologie die is afgestemd op menselijke beoordeling: Procesbewuste Redeneringsverificatie maakt gebruik van gestructureerde QA en diagnostiek van de redeneerfase om temporele en causale fouten te detecteren, terwijl Multidimensionale Kwaliteitsbeoordeling de redeneerkwaliteit, temporele consistentie en visuele esthetiek scoort voor rangschikking en modellering van beloningen. Verder introduceren we WorldRewardBench, een voorkeursbenchmark met ongeveer 6.000 door experts geannoteerde paren over 1.400 video's, ter ondersteuning van paarsgewijze en puntgewijze evaluatie van beloningsmodellen. Bij moderne videogeneratoren toont onze resultaten een aanhoudende kloof aan tussen visuele aannemelijkheid en wereldredenering: video's kunnen overtuigend ogen terwijl ze falen in dynamica, causaliteit of informatiebehoud. We zullen onze benchmarks en evaluatietoolkit publiceren om gemeenschapsonderzoek naar werkelijk wereldbewuste videogeneratie te ondersteunen op https://github.com/UniX-AI-Lab/WorldReasonBench/.
English
Commercial video generation systems such as Seedance2.0 and Veo3.1 have rapidly improved, strengthening the view that video generators may be evolving into "world simulators." Yet the community still lacks a benchmark that directly tests whether a model can reason about how an observed world should evolve over time. We introduce WorldReasonBench, which reframes video generation evaluation as world-state prediction: given an initial state and an action, can a model generate a future video whose state evolution remains physically, socially, logically, and informationally consistent? WorldReasonBench contains 436 curated test cases with structured ground-truth QA annotations spanning four reasoning dimensions and 22 subcategories. We evaluate generated videos with a human-aligned two-part methodology: Process-aware Reasoning Verification uses structured QA and reasoning-phase diagnostics to detect temporal and causal failures, while Multi-dimensional Quality Assessment scores reasoning quality, temporal consistency, and visual aesthetics for ranking and reward modeling. We further introduce WorldRewardBench, a preference benchmark with approximately 6K expert-annotated pairs over 1.4K videos, supporting pair-wise and point-wise reward-model evaluation. Across modern video generators, our results expose a persistent gap between visual plausibility and world reasoning: videos can look convincing while failing dynamics, causality, or information preservation. We will release our benchmarks and evaluation toolkit to support community research on genuinely world-aware video generation at https://github.com/UniX-AI-Lab/WorldReasonBench/.