MuSS : un ensemble de données à grande échelle et un benchmark narratif cinématographique pour la génération vidéo multi-plan à partir d'un sujet
MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
May 9, 2026
Auteurs: Haojie Zhang, Di Wu, Bingyan Liu, Linjie Zhong, Yuancheng Wei, Xingsong Ye, Nanqing Liu, Yaling Liang
cs.AI
Résumé
Alors que les modèles fondamentaux vidéo excellent dans la génération en plan unique, la narration cinématographique du monde réel repose intrinsèquement sur un séquençage multi-plan complexe. Les progrès supplémentaires sont limités par l'absence de jeux de données répondant à trois défis fondamentaux : une logique narrative authentique, des conflits d'alignement spatiotemporel texte-vidéo, et le dilemme du « copier-coller » qui prévaut dans la génération Sujet-vers-Vidéo (S2V). Pour combler cette lacune, nous présentons MuSS, un jeu de données à grande échelle et à double piste, conçu pour la génération multi-plan et S2V. Provenant de plus de 3 000 films, MuSS prend explicitement en charge à la fois les transitions de montage complexes et les récits centrés sur le sujet. Pour construire ce jeu de données, nous innovons avec un pipeline de légendage progressif qui élimine les conflits contextuels en garantissant une précision locale au niveau du plan avant d'assurer une cohérence narrative globale. Crucialement, nous implémentons un mécanisme de correspondance inter-plan pour éradiquer fondamentalement le raccourci de copier-coller en S2V. Parallèlement au jeu de données, nous proposons le Benchmark de Narration Cinématographique, intégrant un paradigme piloté par la logique visuelle et une nouvelle métrique de Variance Anti-Copier-Coller (ACP-Var) pour évaluer rigoureusement la narration continue et la cohérence structurelle 3D. Des expériences approfondies démontrent que, alors que les bases de référence actuelles peinent avec la logique narrative continue ou dégénèrent en simples générateurs d'autocollants 2D, notre modèle enrichi par MuSS atteint une efficacité narrative de pointe et une préservation de l'identité inter-plan.
English
While video foundation models excel at single-shot generation, real-world cinematic storytelling inherently relies on complex multi-shot sequencing. Further progress is constrained by the absence of datasets that address three core challenges: authentic narrative logic, spatiotemporal text-video alignment conflicts, and the "copy-paste" dilemma prevalent in Subject-to-Video (S2V) generation. To bridge this gap, we introduce MuSS, a large-scale, dual-track dataset tailored for multi-shot video and S2V generation. Sourced from over 3,000 movies, MuSS explicitly supports both complex montage transitions and subject-centric narratives. To construct this dataset, we pioneer a progressive captioning pipeline that eliminates contextual conflicts by ensuring local shot-level accuracy before enforcing global narrative coherence. Crucially, we implement a cross-shot matching mechanism to fundamentally eradicate the S2V copy-paste shortcut. Alongside the dataset, we propose the Cinematic Narrative Benchmark, featuring a visual-logic-driven paradigm and a novel Anti-Copy-Paste Variance (ACP-Var) metric to rigorously assess continuous storytelling and 3D structural consistency. Extensive experiments demonstrate that while current baselines struggle with continuous narrative logic or degenerate into trivial 2D sticker generators, our MuSS-augmented model achieves state-of-the-art narrative effectiveness and cross-shot identity preservation.