ChatPaper.aiChatPaper

Vera: Um Modelo de Difusão em Camadas para Edição de Vídeo com Preservação de Conteúdo

Vera: A Layered Diffusion Model for Content-Preserving Video Editing

June 22, 2026
Autores: Hongkai Zheng, Ta-Ying Cheng, Benjamin Klein, Yisong Yue, Zhuoning Yuan
cs.AI

Resumo

Modelos de difusão de vídeo permitiram progressos notáveis na geração e edição de vídeos. No entanto, a preservação de conteúdo continua sendo um desafio central: os métodos existentes regeneram cada pixel e frequentemente alteram elementos que deveriam permanecer inalterados, como personagens ou cenas de fundo. Apresentamos Vera, uma estrutura de difusão em camadas para edição de vídeo com preservação de conteúdo. Em vez de regenerar o vídeo inteiro, a Vera gera uma camada de edição juntamente com um alfa mate para composição com o vídeo de origem, separando a edição criativa da preservação de conteúdo por design. Para incentivar uma composição coerente com o vídeo de origem, estendemos o DiT texto-para-vídeo para uma arquitetura Mixture-of-Transformers (MoT), com DiTs separados para cada camada que interagem por meio de autoatenção conjunta. Para apoiar o treinamento da Vera, construímos ainda um conjunto de dados em camadas de alta qualidade com alfa mates precisos, cenas e dinâmicas diversas, e efeitos visuais. Em nossa avaliação quantitativa e estudo de preferência humana, a Vera supera modelos de edição de vídeo de código aberto líderes na preservação de conteúdo, mantendo-se competitiva na qualidade de edição, utilizando 486 mil quadros de dados de treinamento em camadas.
English
Video diffusion models have enabled remarkable progress in video generation and editing. However, content preservation remains a core challenge: existing methods regenerate every pixel and often alter elements that should remain unchanged, such as characters or background scenes. We introduce Vera, a layered diffusion framework for content-preserving video editing. Instead of regenerating the entire video, Vera generates an edit layer along with an alpha matte for compositing with the source video, separating creative editing from content preservation by design. To encourage coherent composition with the source video, we extend the text-to-video DiT into a Mixture-of-Transformers (MoT) architecture, with separate DiTs for each layer that interact through joint self-attention. To support the training of Vera, we further construct a high-quality layered dataset with accurate alpha mattes, diverse scenes and dynamics, and visual effects. Across our quantitative benchmark and human preference study, Vera outperforms leading open-source video editing models in content preservation while remaining competitive in edit quality, using 486K frames of layered training data.