Generador de Películas: Un Conjunto de Modelos Fundamentales de Medios

Resumen

Presentamos Movie Gen, un elenco de modelos base que genera videos de alta calidad en HD de 1080p con diferentes relaciones de aspecto y audio sincronizado. También mostramos capacidades adicionales como la edición de video basada en instrucciones precisas y la generación de videos personalizados basados en la imagen de un usuario. Nuestros modelos establecen un nuevo estado del arte en múltiples tareas: síntesis de texto a video, personalización de video, edición de video, generación de audio a partir de video y generación de audio a partir de texto. Nuestro modelo de generación de video más grande es un transformador de 30 mil millones de parámetros entrenado con una longitud de contexto máxima de 73 mil tokens de video, lo que corresponde a un video generado de 16 segundos a 16 cuadros por segundo. Mostramos múltiples innovaciones técnicas y simplificaciones en la arquitectura, espacios latentes, objetivos y recetas de entrenamiento, curación de datos, protocolos de evaluación, técnicas de paralelización y optimizaciones de inferencia que nos permiten cosechar los beneficios de escalar datos de pre-entrenamiento, tamaño del modelo y cómputo de entrenamiento para entrenar modelos de generación de medios a gran escala. Esperamos que este documento ayude a la comunidad de investigación a acelerar el progreso y la innovación en modelos de generación de medios. Todos los videos de este documento están disponibles en https://go.fb.me/MovieGenResearchVideos.

English

We present Movie Gen, a cast of foundation models that generates high-quality, 1080p HD videos with different aspect ratios and synchronized audio. We also show additional capabilities such as precise instruction-based video editing and generation of personalized videos based on a user's image. Our models set a new state-of-the-art on multiple tasks: text-to-video synthesis, video personalization, video editing, video-to-audio generation, and text-to-audio generation. Our largest video generation model is a 30B parameter transformer trained with a maximum context length of 73K video tokens, corresponding to a generated video of 16 seconds at 16 frames-per-second. We show multiple technical innovations and simplifications on the architecture, latent spaces, training objectives and recipes, data curation, evaluation protocols, parallelization techniques, and inference optimizations that allow us to reap the benefits of scaling pre-training data, model size, and training compute for training large scale media generation models. We hope this paper helps the research community to accelerate progress and innovation in media generation models. All videos from this paper are available at https://go.fb.me/MovieGenResearchVideos.