ChatPaper.aiChatPaper

Geração de Vídeo com Latentes Preditivos

Video Generation with Predictive Latents

May 4, 2026
Autores: Yian Zhao, Feng Wang, Qiushan Guo, Chang Liu, Xiangyang Ji, Jian Zhang, Jie Chen
cs.AI

Resumo

O Video Autoencoder Variacional (VAE) permite a modelagem generativa de vídeos latentes ao mapear o mundo visual em espaços latentes espaço-temporais compactos, melhorando a eficiência e estabilidade do treinamento. Embora os VAEs de vídeo existentes atinjam qualidade de reconstrução louvável, a otimização contínua da reconstrução não se traduz necessariamente em melhor desempenho generativo. Como melhorar a difusibilidade dos latentes de vídeo permanece um desafio crítico e não resolvido. Neste trabalho, inspirados pelos princípios da modelagem preditiva do mundo, investigamos o potencial da aprendizagem preditiva para melhorar a modelagem generativa de vídeo. Para isso, introduzimos um objetivo de reconstrução preditiva simples e eficaz que unifica a aprendizagem preditiva com a reconstrução de vídeo. Especificamente, descartamos aleatoriamente quadros futuros e codificamos apenas observações parciais do passado, enquanto treinamos o decodificador para reconstruir os quadros observados e prever os futuros simultaneamente. Este projeto incentiva o espaço latente a codificar estruturas temporalmente preditivas e construir uma compreensão mais coerente da dinâmica do vídeo, melhorando assim a qualidade da geração. Nosso modelo, denominado Predictive Video VAE (PV-VAE), atua com desempenho superior na geração de vídeo, com convergência 52% mais rápida e uma melhoria de 34,42 no FVD em relação ao Wan2.2 VAE no UCF101. Além disso, análises abrangentes demonstram que o PV-VAE não apenas exibe escalabilidade favorável, com desempenho generativo melhorando juntamente com o treinamento do VAE, mas também produz ganhos consistentes na compreensão de vídeo downstream, destacando um espaço latente que captura efetivamente a coerência temporal e os priors de movimento.
English
Video Variational Autoencoder (VAE) enables latent video generative modeling by mapping the visual world into compact spatiotemporal latent spaces, improving training efficiency and stability. While existing video VAEs achieve commendable reconstruction quality, continued optimization of reconstruction does not necessarily translate into improved generative performance. How to enhance the diffusability of video latents remains a critical and unresolved challenge. In this work, inspired by principles of predictive world modeling, we investigate the potential of predictive learning to improve the video generative modeling. To this end, we introduce a simple and effective predictive reconstruction objective that unifies predictive learning with video reconstruction. Specifically, we randomly discard future frames and encode only partial past observations, while training the decoder to reconstruct the observed frames and predict future ones simultaneously. This design encourages the latent space to encode temporally predictive structures and build a more coherent understanding of video dynamics, thereby improving generation quality. Our model, termed Predictive Video VAE (PV-VAE), achieves superior performance on video generation, with 52% faster convergence and a 34.42 FVD improvement over the Wan2.2 VAE on UCF101. Furthermore, comprehensive analyses demonstrate that PV-VAE not only exhibits favorable scalability, with generative performance improving alongside VAE training, but also yields consistent gains in downstream video understanding, underscoring a latent space that effectively captures temporal coherence and motion priors.