DomainShuttle: Geração de Texto para Vídeo Orientada por Sujeito em Domínio Aberto e de Forma Livre
DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation
June 24, 2026
Autores: Nan Chen, Yiyang Cai, Rongchang Xie, Junwen Pan, Cheng Chen, Weinan Jia, Zhuowei Chen, Wen Zhou, Zhenbang Sun, Wenhan Luo
cs.AI
Resumo
A geração de texto para vídeo (S2V) orientada por sujeito em domínio aberto tem despertado grande interesse na academia e na indústria. A S2V em domínio aberto envolve principalmente dois cenários: intradomínio, que exige a retenção máxima possível das características do sujeito de referência, e interdomínio, que preserva as características intrínsecas do sujeito enquanto permite que propriedades irrelevantes ao sujeito variem de forma flexível de acordo com o prompt textual. Os métodos existentes focam-se principalmente em maximizar a fidelidade ao sujeito em cenários intradomínio, o que limita sua editabilidade e adaptabilidade em cenários interdomínio, como estilos inovadores, combinações semânticas ou atributos de domínio. Neste estudo, propomos que um método ideal de S2V deve transitar de forma flexível entre diferentes domínios, alcançando um desempenho robusto tanto em cenários intradomínio quanto interdomínio. Para tal, apresentamos o DomainShuttle, que possibilita alta fidelidade e flexibilidade generativa para a personalização de vídeos em domínio aberto. Especificamente, introduzimos o Domain-MoT, que desacopla os vídeos e as características de referência e incorpora o AdaLN ciente do domínio para modelagem específica de domínio das imagens de referência. Em seguida, apresentamos o esquema Video-Reference DualRoPE, que posiciona os tokens da imagem de referência e os tokens do vídeo em espaços RoPE separados para permitir uma modelagem espacial precisa ao nível do sujeito, e a Perda de Consistência entre Pares Cruzados, que visa extrair características intrínsecas do sujeito não afetadas por características irrelevantes. Experimentos extensivos demonstram que o DomainShuttle atinge melhorias significativas de desempenho em relação aos métodos existentes, exibindo alta fidelidade ao sujeito e flexibilidade generativa em diversos cenários de aplicação em domínio aberto.
English
Open domain subject-driven text-to-video (S2V) generation has drawn significant interest in academia and industry. Open domain S2V mainly involves two scenarios: in-domain, which requires retaining the reference subject features as much as possible, and cross-domain, which preserves the intrinsic features of the subject while allowing subject-irrelevant properties to vary flexibly according to the text prompt. Existing methods primarily focus on maximizing subject fidelity in in-domain scenarios, which limits their editability and adaptability in cross-domain scenarios, such as novel styles, semantic combinations, or domain attributes. In this study, we propose that an ideal S2V method should flexibly shuttle between different domains, achieving strong performance in both in-domain and cross-domain scenarios. To this end, we propose DomainShuttle, which could achieve high fidelity and generative flexibility for open domain video personalization. Specifically, we introduce Domain-MoT, which decouples videos and reference features and introduces the domain-aware AdaLN for domain-specific modeling of reference images. We then introduce the Video-Reference DualRoPE scheme, which places reference image tokens and video tokens in separate RoPE spaces to enable precise subject-level spatial modeling, and Cross-Pair Consistent Loss, which aims to extract intrinsic subject features unaffected by irrelevant features. Extensive experiments demonstrate that DomainShuttle achieves significant performance improvements over existing methods, exhibiting high subject fidelity and generative flexibility across diverse open domain application scenarios.