ChatPaper.aiChatPaper

UnityShots: Geração de Áudio e Vídeo Multi-Cena Orientada por Memória com Portão Consciente de Limites

UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

June 19, 2026
Autores: Jiehui Huang, Yuechen Zhang, Bin Xia, Jiahao Wang, Xu He, Zhenchao Tang, Meng Chu, Xin Tao, Pengfei Wan, Jiaya Jia
cs.AI

Resumo

Gerar um vídeo coerente de múltiplos planos requer memória estruturada entre planos. A aparência do sujeito, o contexto da cena e a identidade do locutor devem persistir entre os cortes. Abordagens existentes ou treinam de ponta a ponta em sequências de comprimento fixo e não conseguem escalar, geram plano por plano com bancos de memória que crescem linearmente, ou orquestram geradores pré-treinados sob um planejador de LLM sem uma espinha dorsal ciente de múltiplos planos. Apresentamos o UnityShots, um sistema de geração audiovisual de múltiplos planos orientado por memória, construído sobre o LTX-2.3 e treinado em planos anotados de cinema e videoclipes. O fluxo de vídeo mantém dois slots de tamanho fixo: um slot de memória de longo prazo (LTM) ancorado no plano de abertura e um slot de memória de curto prazo (STM) contendo a cauda imediatamente anterior, ambos atualizados a cada corte por uma porta condicionada por limite que funde a probabilidade de corte visual e sinais de rastreador de batidas. O fluxo de áudio injeta um token de referência do locutor em cada plano para preservar o timbre vocal sem um banco de áudio deslizante. Um prior discreto de tipo de corte, aprendido por meio de AdaLN, torna-se um parâmetro de controle no momento da inferência sobre a intensidade da transição. Lançamos um benchmark de 200 sequências multiculturais de múltiplos planos, abrangendo seis regiões étnicas e dez ou mais idiomas, com identidades de referência por plano, áudio de referência e rótulos de transição por limite. Avaliado nos modos de condicionamento I2V, T2V e R2V, o UnityShots supera as bases de referência de código aberto em todas as métricas de coerência entre planos e iguala o sistema de código fechado mais forte nos eixos de múltiplos planos.
English
Generating a coherent multi-shot video requires structured cross-shot memory. Subject appearance, scene context, and speaker identity must persist across cuts. Existing approaches either train end-to-end over fixed-length sequences and cannot scale, generate shot-by-shot with memory banks that grow linearly, or orchestrate pretrained generators under an LLM planner without a multi-shot-aware backbone. We present UnityShots, a memory-driven multi-shot audio-video generation system built on LTX-2.3, trained on annotated cinematic and music-video shots. The video stream maintains two fixed-size slots, a long-term memory (LTM) slot anchored to the opening shot and a short-term memory (STM) slot holding the immediately preceding tail, both updated at every cut by a boundary-conditioned gate that fuses visual cut probability and beat-tracker signals. The audio stream injects a reference speaker token at every shot to preserve vocal timbre without a sliding audio bank. A discrete cut-type prior, learned through AdaLN, becomes an inference-time control knob over transition strength. We release a benchmark of 200 multi-cultural multi-shot sequences spanning six ethnic regions and ten or more languages, with per-shot reference identities, reference audio, and per-boundary transition labels. Evaluated across I2V, T2V, and R2V conditioning modes, UnityShots leads open-source baselines on every cross-shot coherence metric and matches the strongest closed-source system on the multi-shot axes.