ChatPaper.aiChatPaper

JoyAI-Video-Edit:基于自回归扩散的实时开放性视频编辑

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

August 4, 2026
作者: Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan
cs.AI

摘要

实时视频编辑需要在有限计算资源下实现低延迟因果生成,同时保持源保真度和长期时序一致性。我们提出JoyAI-Video-Edit,一个160亿参数的自回归扩散框架,用于无需访问未来帧或预定义视频时长的实时开放式视频编辑。我们的方法结合了分块自回归适配、源锚定分布匹配蒸馏(SA-DMD)和长视野自回归蒸馏,以减少训练-推理不一致、在两步生成中保持源保真度,并缓解累积的时序漂移。大量自动化和人工评估表明,JoyAI-Video-Edit显著优于现有流式编辑器,并在短视频和长视频上与强离线系统保持竞争力。完整系统在单个Nvidia B200 GPU上实现了约30 FPS的端到端720p视频编辑。代码已开源:https://github.com/jd-opensource/JoyAI-Video-Edit。
English
Real-time video editing requires low-latency causal generation with bounded computational resources while preserving source fidelity and long-term temporal consistency. We present JoyAI-Video-Edit, a 16B-parameter autoregressive diffusion framework for real-time, open-ended video editing without access to future frames or a predefined video duration. Our method combines chunk-wise autoregressive adaptation, Source-Anchored Distribution Matching Distillation (SA-DMD), and Long-Horizon Autoregressive Distillation to reduce train--inference mismatch, preserve source fidelity during two-step generation, and mitigate accumulated temporal drift. Extensive automatic and human evaluations show that JoyAI-Video-Edit substantially outperforms existing streaming editors and remains competitive with strong offline systems on both short and long videos. The complete system achieves end-to-end 720p video editing at approximately 30 FPS on a single Nvidia B200 GPU. Code is available at https://github.com/jd-opensource/JoyAI-Video-Edit.