Films Gen: Een Cast van Media Foundation ModellenMovie Gen: A Cast of Media Foundation Models
Wij presenteren Movie Gen, een reeks basismodellen die hoogwaardige, 1080p HD-video's genereert met verschillende beeldverhoudingen en gesynchroniseerd geluid. We tonen ook aanvullende mogelijkheden zoals nauwkeurige instructiegebaseerde videobewerking en de generatie van gepersonaliseerde video's op basis van een afbeelding van een gebruiker. Onze modellen zetten een nieuwe state-of-the-art neer op meerdere taken: tekst-naar-video synthese, video personalisatie, videobewerking, video-naar-audio generatie, en tekst-naar-audio generatie. Ons grootste videogeneratiemodel is een 30B-parameters transformer die is getraind met een maximale contextlengte van 73K video tokens, wat overeenkomt met een gegenereerde video van 16 seconden bij 16 frames per seconde. We tonen meerdere technische innovaties en vereenvoudigingen op het gebied van architectuur, latente ruimtes, trainingsdoelstellingen en recepten, gegevenscuratie, evaluatieprotocollen, parallelisatietechnieken, en inferentie-optimalisaties die ons in staat stellen om de voordelen te benutten van het schalen van pre-trainingsgegevens, modelgrootte, en trainingsberekeningen voor het trainen van grootschalige mediageneratiemodellen. We hopen dat dit artikel de onderzoeksgemeenschap helpt om vooruitgang en innovatie in mediageneratiemodellen te versnellen. Alle video's uit dit artikel zijn beschikbaar op https://go.fb.me/MovieGenResearchVideos.