UniVidX: Uma Estrutura Multimodal Unificada para Geração Versátil de Vídeos via Prioridades de Difusão
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
May 1, 2026
Autores: Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao
cs.AI
Resumo
Os avanços recentes demonstraram que os modelos de difusão de vídeo (VDMs) podem ser adaptados para diversas tarefas de gráficos multimodais. No entanto, os métodos existentes frequentemente treinam modelos separados para cada configuração de problema, o que fixa o mapeamento entrada-saída e limita a modelagem de correlações entre modalidades. Apresentamos o UniVidX, uma estrutura multimodal unificada que aproveita os priors de VDM para geração versátil de vídeo. O UniVidX formula tarefas alinhadas a pixels como geração condicional em um espaço multimodal compartilhado, adapta-se a distribuições específicas por modalidade preservando os priors nativos da estrutura base, e promove consistência cross-modal durante a síntese. Ele é construído sobre três projetos-chave. O Mascaramento Condicional Estocástico (SCM) particiona aleatoriamente as modalidades em condições limpas e alvos ruidosos durante o treinamento, permitindo geração condicional omnidirecional em vez de mapeamentos fixos. O LoRA com Porta Desacoplada (DGL) introduz LoRAs por modalidade que são ativados quando uma modalidade serve como alvo de geração, preservando os fortes priors do VDM. A Autoatenção Cross-Modal (CMSA) compartilha chaves e valores entre modalidades mantendo consultas específicas por modalidade, facilitando a troca de informações e o alinhamento intermodal. Instanciamos o UniVidX em dois domínios: UniVid-Intrínseco, para vídeos RGB e mapas intrínsecos incluindo albedo, irradiância e normal; e UniVid-Alfa, para vídeos RGB compostos e suas camadas constituintes RGBA. Experimentos mostram que ambos os modelos alcançam desempenho competitivo com os métodos state-of-the-art em tarefas distintas e generalizam robustamente para cenários do mundo real, mesmo quando treinados com menos de 1.000 vídeos. Página do projeto: https://houyuanchen111.github.io/UniVidX.github.io/
English
Recent progress has shown that video diffusion models (VDMs) can be repurposed for diverse multimodal graphics tasks. However, existing methods often train separate models for each problem setting, which fixes the input-output mapping and limits the modeling of correlations across modalities. We present UniVidX, a unified multimodal framework that leverages VDM priors for versatile video generation. UniVidX formulates pixel-aligned tasks as conditional generation in a shared multimodal space, adapts to modality-specific distributions while preserving the backbone's native priors, and promotes cross-modal consistency during synthesis. It is built on three key designs. Stochastic Condition Masking (SCM) randomly partitions modalities into clean conditions and noisy targets during training, enabling omni-directional conditional generation instead of fixed mappings. Decoupled Gated LoRA (DGL) introduces per-modality LoRAs that are activated when a modality serves as the generation target, preserving the strong priors of the VDM. Cross-Modal Self-Attention (CMSA) shares keys and values across modalities while keeping modality-specific queries, facilitating information exchange and inter-modal alignment. We instantiate UniVidX in two domains: UniVid-Intrinsic, for RGB videos and intrinsic maps including albedo, irradiance, and normal; and UniVid-Alpha, for blended RGB videos and their constituent RGBA layers. Experiments show that both models achieve performance competitive with state-of-the-art methods across distinct tasks and generalize robustly to in-the-wild scenarios, even when trained on fewer than 1,000 videos. Project page: https://houyuanchen111.github.io/UniVidX.github.io/