MuSS: Um Conjunto de Dados de Grande Escala e um Benchmark de Narrativa Cinematográfica para Geração de Vídeo de Sujeito com Múltiplas Tomadas
MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
May 9, 2026
Autores: Haojie Zhang, Di Wu, Bingyan Liu, Linjie Zhong, Yuancheng Wei, Xingsong Ye, Nanqing Liu, Yaling Liang
cs.AI
Resumo
Embora os modelos fundamentais de vídeo se destaquem na geração de plano único, a narrativa cinematográfica do mundo real depende inerentemente de um complexo sequenciamento de múltiplos planos. O progresso adicional é limitado pela ausência de conjuntos de dados que abordem três desafios centrais: lógica narrativa autêntica, conflitos de alinhamento espaço-temporal texto-vídeo e o dilema de "copiar e colar" predominante na geração Sujeito para Vídeo (S2V). Para preencher essa lacuna, apresentamos o MuSS, um conjunto de dados em larga escala e de dupla trilha, projetado especificamente para geração de múltiplos planos e S2V. Originado de mais de 3.000 filmes, o MuSS suporta explicitamente tanto transições complexas de montagem quanto narrativas centradas no sujeito. Para construir esse conjunto de dados, pioneiramente desenvolvemos um pipeline progressivo de legendagem que elimina conflitos contextuais, garantindo precisão local no nível do plano antes de impor coerência narrativa global. Crucialmente, implementamos um mecanismo de correspondência entre planos para erradicar fundamentalmente o atalho de copiar e colar do S2V. Juntamente com o conjunto de dados, propomos o Benchmark de Narrativa Cinematográfica, apresentando um paradigma orientado por lógica visual e uma nova métrica de Variância Anti-Cópia-e-Cola (ACP-Var) para avaliar rigorosamente a narrativa contínua e a consistência estrutural 3D. Experimentos extensivos demonstram que, enquanto as linhas de base atuais lutam com a lógica narrativa contínua ou degeneram em geradores triviais de adesivos 2D, nosso modelo aumentado com MuSS alcança eficácia narrativa de estado da arte e preservação de identidade entre planos.
English
While video foundation models excel at single-shot generation, real-world cinematic storytelling inherently relies on complex multi-shot sequencing. Further progress is constrained by the absence of datasets that address three core challenges: authentic narrative logic, spatiotemporal text-video alignment conflicts, and the "copy-paste" dilemma prevalent in Subject-to-Video (S2V) generation. To bridge this gap, we introduce MuSS, a large-scale, dual-track dataset tailored for multi-shot video and S2V generation. Sourced from over 3,000 movies, MuSS explicitly supports both complex montage transitions and subject-centric narratives. To construct this dataset, we pioneer a progressive captioning pipeline that eliminates contextual conflicts by ensuring local shot-level accuracy before enforcing global narrative coherence. Crucially, we implement a cross-shot matching mechanism to fundamentally eradicate the S2V copy-paste shortcut. Alongside the dataset, we propose the Cinematic Narrative Benchmark, featuring a visual-logic-driven paradigm and a novel Anti-Copy-Paste Variance (ACP-Var) metric to rigorously assess continuous storytelling and 3D structural consistency. Extensive experiments demonstrate that while current baselines struggle with continuous narrative logic or degenerate into trivial 2D sticker generators, our MuSS-augmented model achieves state-of-the-art narrative effectiveness and cross-shot identity preservation.