ChatPaper.aiChatPaper

LiveEdit: Naar real-time diffusiegebaseerde streaming videobewerking

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

June 25, 2026
Auteurs: Xinyu Wang, Chongbo Zhao, Fangneng Zhan, Yue Ma
cs.AI

Samenvatting

Stream-videobewerking heeft snelle vooruitgang geboekt, maar praktische implementatie wordt nog steeds beperkt door twee kernproblemen: het handhaven van stabiele achtergronden en onbewerkte regio's in de loop van de tijd, en het bereiken van de lage latentie die vereist is voor real-time interactieve scenario's. Ondertussen zijn recente methoden voor het genereren van streamingvideo's meestal ontwikkeld voor synthese en kunnen ze niet rechtstreeks worden toegepast op bewerking vanwege de strikte bewaringsvereiste en regiospecifieke controle. In dit werk presenteren we een nieuw raamwerk voor streaming videobewerking dat causale, frame-voor-frame bewerking uitvoert met sterke inhoudsbehoud en real-time responsiviteit. Ons belangrijkste ontwerp is een driefasige distillatiepijplijn die de bewerkingsmogelijkheid geleidelijk overdraagt van een krachtig bidirectioneel funderingsmodel naar een efficiënte unidirectionele streaming-editor, waardoor stabiele langetermijnbewerkingen mogelijk worden zonder visuele getrouwheid op te offeren. Om real-time implementatie verder te ondersteunen, introduceren we een AR-gerichte maskercache die regio-gerelateerde berekeningen over frames heen hergebruikt, waardoor redundante verwerking aanzienlijk wordt verminderd en de inferentie wordt versneld. Ten slotte stellen we een specifieke benchmark op voor streaming videobewerking. Uitgebreide evaluaties tonen aan dat onze methode de beste visuele kwaliteit bereikt onder streaming-baselines, terwijl de inferentiesnelheid drastisch wordt verhoogd tot 12,66 FPS, waardoor het geschikt is voor interactieve en augmented reality-toepassingen.
English
Streaming video editing has made rapid progress, yet practical deployment is still limited by two core issues: maintaining stable backgrounds and non-edited regions over time, and achieving the low latency required for real-time interactive scenarios. Meanwhile, recent streaming video generation methods are mostly developed for synthesis and cannot be directly applied to editing due to the strict preservation requirement and region-specific control. In this work, we present a novel streaming video editing framework that performs causal, frame-by-frame editing with strong content preservation and real-time responsiveness. Our key design is a three-stage distillation pipeline that progressively transfers editing capability from a powerful bidirectional foundation model to an efficient unidirectional streaming editor, enabling stable long-horizon edits without sacrificing visual fidelity. To further support real-time deployment, we introduce an AR-oriented mask cache that reuses region-related computation across frames, substantially reducing redundant processing and accelerating inference. Finally, we establish a dedicated benchmark for streaming video editing. Extensive evaluations demonstrate that our method achieves state-of-the-art visual quality among streaming baselines while drastically boosting inference speed to 12.66 FPS, making it suitable for interactive and augmented reality applications.