Film Gen : Un Casting de Modèles de Fondation de Médias

Résumé

Nous présentons Movie Gen, un ensemble de modèles de base qui génère des vidéos haute qualité en 1080p avec différents ratios d'aspect et une audio synchronisée. Nous montrons également des capacités supplémentaires telles que le montage vidéo précis basé sur des instructions et la génération de vidéos personnalisées basées sur l'image d'un utilisateur. Nos modèles établissent un nouvel état de l'art sur plusieurs tâches : synthèse texte-vidéo, personnalisation vidéo, montage vidéo, génération vidéo-audio et génération texte-audio. Notre plus grand modèle de génération vidéo est un transformateur de 30 milliards de paramètres entraîné avec une longueur de contexte maximale de 73 000 jetons vidéo, correspondant à une vidéo générée de 16 secondes à 16 images par seconde. Nous présentons plusieurs innovations techniques et simplifications sur l'architecture, les espaces latents, les objectifs et recettes d'entraînement, la curation des données, les protocoles d'évaluation, les techniques de parallélisation et les optimisations de l'inférence qui nous permettent de tirer parti de la mise à l'échelle des données de pré-entraînement, de la taille du modèle et de la puissance de calcul d'entraînement pour former des modèles de génération de médias à grande échelle. Nous espérons que cet article aidera la communauté de recherche à accélérer les progrès et l'innovation dans les modèles de génération de médias. Toutes les vidéos de cet article sont disponibles sur https://go.fb.me/MovieGenResearchVideos.

English

We present Movie Gen, a cast of foundation models that generates high-quality, 1080p HD videos with different aspect ratios and synchronized audio. We also show additional capabilities such as precise instruction-based video editing and generation of personalized videos based on a user's image. Our models set a new state-of-the-art on multiple tasks: text-to-video synthesis, video personalization, video editing, video-to-audio generation, and text-to-audio generation. Our largest video generation model is a 30B parameter transformer trained with a maximum context length of 73K video tokens, corresponding to a generated video of 16 seconds at 16 frames-per-second. We show multiple technical innovations and simplifications on the architecture, latent spaces, training objectives and recipes, data curation, evaluation protocols, parallelization techniques, and inference optimizations that allow us to reap the benefits of scaling pre-training data, model size, and training compute for training large scale media generation models. We hope this paper helps the research community to accelerate progress and innovation in media generation models. All videos from this paper are available at https://go.fb.me/MovieGenResearchVideos.