ChatPaper.aiChatPaper

LiveEdit: Rumo à Edição de Vídeo em Streaming em Tempo Real Baseada em Difusão

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

June 25, 2026
Autores: Xinyu Wang, Chongbo Zhao, Fangneng Zhan, Yue Ma
cs.AI

Resumo

A edição de vídeo em streaming tem avançado rapidamente, mas sua implantação prática ainda é limitada por duas questões centrais: a manutenção de fundos estáveis e de regiões não editadas ao longo do tempo, e a obtenção da baixa latência necessária para cenários interativos em tempo real. Paralelamente, os métodos recentes de geração de vídeo em streaming são em sua maioria desenvolvidos para síntese, não podendo ser aplicados diretamente à edição devido ao requisito de preservação estrita e ao controle específico de regiões. Neste trabalho, apresentamos uma nova estrutura de edição de vídeo em streaming que realiza edição causal, quadro a quadro, com forte preservação de conteúdo e capacidade de resposta em tempo real. Nosso projeto-chave é um pipeline de destilação em três estágios que transfere progressivamente a capacidade de edição de um poderoso modelo fundamental bidirecional para um editor de streaming unidirecional eficiente, possibilitando edições estáveis em horizontes longos sem sacrificar a fidelidade visual. Para apoiar ainda mais a implantação em tempo real, introduzimos um cache de máscara orientado a RA que reutiliza a computação relacionada a regiões entre quadros, reduzindo substancialmente o processamento redundante e acelerando a inferência. Por fim, estabelecemos um benchmark dedicado para edição de vídeo em streaming. Avaliações extensas demonstram que nosso método atinge qualidade visual de estado da arte entre as bases de streaming, ao mesmo tempo que aumenta drasticamente a velocidade de inferência para 12,66 FPS, tornando-o adequado para aplicações interativas e de realidade aumentada.
English
Streaming video editing has made rapid progress, yet practical deployment is still limited by two core issues: maintaining stable backgrounds and non-edited regions over time, and achieving the low latency required for real-time interactive scenarios. Meanwhile, recent streaming video generation methods are mostly developed for synthesis and cannot be directly applied to editing due to the strict preservation requirement and region-specific control. In this work, we present a novel streaming video editing framework that performs causal, frame-by-frame editing with strong content preservation and real-time responsiveness. Our key design is a three-stage distillation pipeline that progressively transfers editing capability from a powerful bidirectional foundation model to an efficient unidirectional streaming editor, enabling stable long-horizon edits without sacrificing visual fidelity. To further support real-time deployment, we introduce an AR-oriented mask cache that reuses region-related computation across frames, substantially reducing redundant processing and accelerating inference. Finally, we establish a dedicated benchmark for streaming video editing. Extensive evaluations demonstrate that our method achieves state-of-the-art visual quality among streaming baselines while drastically boosting inference speed to 12.66 FPS, making it suitable for interactive and augmented reality applications.