ChatPaper.aiChatPaper

Grafo de Cena de Questões de Física: Avaliação de Granularidade Fina da Plausibilidade Física na Geração de Texto para Vídeo

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

June 24, 2026
Autores: Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal
cs.AI

Resumo

Modelos de geração de vídeo são cada vez mais capazes de produzir vídeos realistas, mas ainda enfrentam dificuldades em gerar vídeos que sigam leis físicas básicas. Agravando esse problema, há uma falta de métodos de avaliação granular confiáveis para localizar e especificar violações de leis físicas em vídeos. Abordamos essa questão introduzindo o Physics Question Scene Graph (PQSG), um pipeline de avaliação hierárquica baseado em perguntas. O PQSG avalia vídeos gerados verificando sua fidelidade a um prompt em relação a objetos, ações e adesão a leis físicas, utilizando uma hierarquia baseada em grafos de perguntas geradas por um modelo de visão e linguagem (VLM), guiado por exemplos de contexto de alta qualidade. Ao representar perguntas como um grafo, o PQSG introduz dependências lógicas entre as perguntas, garantindo que cada consulta seja contextualmente válida. Além disso, o PQSG fornece avaliações granulares sobre quais qualidades do vídeo violam restrições de plausibilidade física. Validamos o PQSG criando o FinePhyEval, um conjunto de dados com prompts baseados em física e vídeos gerados correspondentes de diversos modelos de geração de vídeo de última geração (Sora 2, Veo 3 e Wan 2.1), sendo cada vídeo anotado em múltiplas categorias por humanos. Usando o FinePhyEval, medimos a correlação entre as pontuações granulares do PQSG e os julgamentos humanos, mostrando correlações gerais mais altas do que trabalhos anteriores. Também descobrimos que o PQSG classifica modelos de código fechado como superiores ao Wan 2.1 em realismo físico. Por fim, mostramos que as anotações fornecidas no FinePhyEval também podem ser usadas para avaliação de subtarefas: avaliamos dois VLMs robustos na geração e resposta de perguntas, constatando que, embora os modelos possam criar perguntas semelhantes às humanas, ainda ficam aquém do desempenho humano ao respondê-las.
English
Video generation models are increasingly capable of producing realistic videos, but they still struggle to generate videos that follow basic physical laws. Compounding this is a lack of reliable granular evaluation methods for localizing and specifying physical law violations in videos. We address this by introducing Physics Question Scene Graph (PQSG), a hierarchical question-based evaluation pipeline. PQSG evaluates generated videos by checking their faithfulness to a prompt across objects, actions, and adherence to physical laws using a graph-based hierarchy of questions generated by a vision-language model (VLM), guided by high-quality in-context examples. By representing questions as a graph, PQSG introduces logical dependencies within questions, ensuring that each query is contextually valid. Moreover, PQSG provides granular assessments of which qualities of the video violate physical plausibility constraints. We validate PQSG by creating FinePhyEval, a dataset with physics-based prompts and corresponding generated videos from diverse state-of-the-art video generation models (Sora 2, Veo 3, and Wan 2.1), with each video annotated across multiple categories by humans. Using FinePhyEval, we measure the correlation between PQSG's fine-grained scores and human judgments, showing higher overall correlations than prior work. We also find that PQSG ranks closed-source models higher than Wan 2.1 on physical realism. Lastly, we show that the annotations we provide in FinePhyEval can also be used for subtask evaluation: we benchmark two strong VLMs on generating and answering questions, finding that while models can create human-like questions, they still fall short of human performance in answering them.