ChatPaper.aiChatPaper

Sparkle: Realização de Substituição de Fundo de Vídeo Dinâmica Guiada por Instrução por meio de Orientação Desacoplada

Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance

May 7, 2026
Autores: Ziyun Zeng, Yiqi Lin, Guoqiang Liang, Mike Zheng Shou
cs.AI

Resumo

Nos últimos anos, esforços de código aberto como o Senorita-2M têm impulsionado a edição de vídeo em direção ao controle por instruções em linguagem natural. No entanto, os conjuntos de dados publicamente disponíveis atuais concentram-se predominantemente em edições locais ou transferência de estilo, que em grande parte preservam a estrutura original da cena e são mais fáceis de escalar. Em contraste, a Substituição de Fundo, uma tarefa central para aplicações criativas como produção cinematográfica e publicidade, requer a síntese de cenas completamente novas e temporalmente consistentes, mantendo interações precisas entre primeiro plano e fundo, tornando a geração de dados em larga escala significativamente mais desafiadora. Consequentemente, esta tarefa complexa permanece amplamente inexplorada devido à escassez de dados de treinamento de alta qualidade. Esta lacuna é evidente no fraco desempenho dos modelos state-of-the-art, por exemplo, o Kiwi-Edit, porque o principal conjunto de dados de código aberto que contém esta tarefa, ou seja, o OpenVE-3M, frequentemente produz fundos estáticos e artificiais. Neste artigo, rastreamos esta degradação de qualidade à falta de orientação precisa do fundo durante a síntese de dados. Assim, projetamos um *pipeline* escalável que gera orientações de primeiro plano e fundo de maneira desacoplada, com filtragem de qualidade rigorosa. Com base neste *pipeline*, introduzimos o Sparkle, um conjunto de dados de ~140K pares de vídeos abrangendo cinco temas comuns de mudança de fundo, juntamente com o Sparkle-Bench, o maior benchmark de avaliação específico para substituição de fundo até à data. Experimentos demonstram que o nosso conjunto de dados e o modelo treinado nele alcançam um desempenho substancialmente melhor do que todas as *baselines* existentes, tanto no OpenVE-Bench como no Sparkle-Bench. O nosso conjunto de dados, *benchmark* e modelo propostos são totalmente de código aberto em https://showlab.github.io/Sparkle/.
English
In recent years, open-source efforts like Senorita-2M have propelled video editing toward natural language instruction. However, current publicly available datasets predominantly focus on local editing or style transfer, which largely preserve the original scene structure and are easier to scale. In contrast, Background Replacement, a task central to creative applications such as film production and advertising, requires synthesizing entirely new, temporally consistent scenes while maintaining accurate foreground-background interactions, making large-scale data generation significantly more challenging. Consequently, this complex task remains largely underexplored due to a scarcity of high-quality training data. This gap is evident in poorly performing state-of-the-art models, e.g., Kiwi-Edit, because the primary open-source dataset that contains this task, i.e., OpenVE-3M, frequently produces static, unnatural backgrounds. In this paper, we trace this quality degradation to a lack of precise background guidance during data synthesis. Accordingly, we design a scalable pipeline that generates foreground and background guidance in a decoupled manner with strict quality filtering. Building on this pipeline, we introduce Sparkle, a dataset of ~140K video pairs spanning five common background-change themes, alongside Sparkle-Bench, the largest evaluation benchmark tailored for background replacement to date. Experiments demonstrate that our dataset and the model trained on it achieve substantially better performance than all existing baselines on both OpenVE-Bench and Sparkle-Bench. Our proposed dataset, benchmark, and model are fully open-sourced at https://showlab.github.io/Sparkle/.