ChatPaper.aiChatPaper

WorldReasonBench: Testes de Estresse Alinhados ao Humano de Geradores de Vídeo como Preditores de Estado Futuro do Mundo

WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors

May 11, 2026
Autores: Keming Wu, Yijing Cui, Wenhan Xue, Qijie Wang, Xuan Luo, Zhiyuan Feng, Zuhao Yang, Sudong Wang, Sicong Jiang, Haowei Zhu, Zihan Wang, Ping Nie, Wenhu Chen, Bin Wang
cs.AI

Resumo

Sistemas comerciais de geração de vídeo, como Seedance2.0 e Veo3.1, melhoraram rapidamente, fortalecendo a visão de que os geradores de vídeo podem estar evoluindo para "simuladores de mundo". No entanto, a comunidade ainda carece de um benchmark que teste diretamente se um modelo consegue raciocinar sobre como um mundo observado deve evoluir ao longo do tempo. Apresentamos o WorldReasonBench, que reformula a avaliação de geração de vídeo como previsão de estado do mundo: dado um estado inicial e uma ação, o modelo pode gerar um vídeo futuro cuja evolução de estado permaneça fisicamente, socialmente, logicamente e informacionalmente consistente? O WorldReasonBench contém 436 casos de teste selecionados com anotações estruturadas de QA (pergunta-resposta) de referência, abrangendo quatro dimensões de raciocínio e 22 subcategorias. Avaliamos os vídeos gerados com uma metodologia bipartida alinhada a humanos: a Verificação de Raciocínio Ciente do Processo utiliza QA estruturada e diagnósticos de fase de raciocínio para detectar falhas temporais e causais, enquanto a Avaliação de Qualidade Multidimensional pontua a qualidade do raciocínio, a consistência temporal e a estética visual para ranqueamento e modelagem de recompensa. Apresentamos ainda o WorldRewardBench, um benchmark de preferência com aproximadamente 6 mil pares anotados por especialistas em mais de 1,4 mil vídeos, apoiando a avaliação de modelos de recompensa por pares e por pontos. Entre geradores de vídeo modernos, nossos resultados expõem uma lacuna persistente entre plausibilidade visual e raciocínio sobre o mundo: vídeos podem parecer convincentes enquanto falham em dinâmica, causalidade ou preservação de informação. Disponibilizaremos nossos benchmarks e kit de ferramentas de avaliação para apoiar a pesquisa da comunidade em geração de vídeo genuinamente ciente do mundo em https://github.com/UniX-AI-Lab/WorldReasonBench/.
English
Commercial video generation systems such as Seedance2.0 and Veo3.1 have rapidly improved, strengthening the view that video generators may be evolving into "world simulators." Yet the community still lacks a benchmark that directly tests whether a model can reason about how an observed world should evolve over time. We introduce WorldReasonBench, which reframes video generation evaluation as world-state prediction: given an initial state and an action, can a model generate a future video whose state evolution remains physically, socially, logically, and informationally consistent? WorldReasonBench contains 436 curated test cases with structured ground-truth QA annotations spanning four reasoning dimensions and 22 subcategories. We evaluate generated videos with a human-aligned two-part methodology: Process-aware Reasoning Verification uses structured QA and reasoning-phase diagnostics to detect temporal and causal failures, while Multi-dimensional Quality Assessment scores reasoning quality, temporal consistency, and visual aesthetics for ranking and reward modeling. We further introduce WorldRewardBench, a preference benchmark with approximately 6K expert-annotated pairs over 1.4K videos, supporting pair-wise and point-wise reward-model evaluation. Across modern video generators, our results expose a persistent gap between visual plausibility and world reasoning: videos can look convincing while failing dynamics, causality, or information preservation. We will release our benchmarks and evaluation toolkit to support community research on genuinely world-aware video generation at https://github.com/UniX-AI-Lab/WorldReasonBench/.