ChatPaper.aiChatPaper

Edição Unificada de Vídeo via Atenção Esparsa em Contexto

Lightning Unified Video Editing via In-Context Sparse Attention

May 6, 2026
Autores: Shitong Shao, Zikai Zhou, Haopeng Li, Yingwei Song, Wenliang Zhong, Lichen Bai, Zeke Xie
cs.AI

Resumo

A edição de vídeo evoluiu para paradigmas de Aprendizado em Contexto (ICL), mas os custos quadráticos de atenção resultantes criam um gargalo computacional crítico. Neste trabalho, propomos a Atenção Esparsa em Contexto (ISA), o primeiro framework esparso empírico quase sem perdas adaptado para edição de vídeo ICL. Nosso projeto é baseado em dois insights principais: primeiro, os tokens de contexto exibem saliência significativamente menor do que os tokens de origem; segundo, provamos teoricamente e validamos empiricamente que a nitidez da Consulta (Query) correlaciona-se com o erro de aproximação. Motivados por essas descobertas, a ISA implementa uma estratégia de pré-seleção eficiente para podar o contexto redundante, seguida por um mecanismo de agrupamento dinâmico de consultas que direciona consultas de alto erro para atenção completa e consultas de baixo erro para uma atenção esparsa de Taylor de ordem zero computacionalmente eficiente. Além disso, construímos o \texttt{LIVEditor}, um novo modelo de edição de vídeo relâmpago via ISA e um pipeline de dados de edição de vídeo proposto que curou um conjunto de dados de alta qualidade com 1,7 milhão de instâncias. Experimentos extensivos demonstram que o LIVEditor alcança uma redução de ~60% na latência do módulo de atenção, superando os métodos state-of-the-art no EditVerseBench, IVE-Bench e VIE-Bench, oferecendo aceleração quase sem perdas sem comprometer a fidelidade visual.
English
Video editing has evolved toward In-Context Learning (ICL) paradigms, yet the resulting quadratic attention costs create a critical computational bottleneck. In this work, we propose In-context Sparse Attention (ISA), the first near-lossless empirical sparse framework tailored for ICL video editing. Our design is grounded in two key insights: first, context tokens exhibit significantly lower saliency than source tokens; second, we theoretically prove and empirically validate that Query sharpness correlates with approximation error. Motivated by these findings, ISA implements an efficient pre-selection strategy to prune redundant context, followed by a dynamic query grouping mechanism that routes high-error queries to full attention and low-error ones to a computationally efficient 0-th order Taylor sparse attention. Furthermore, we build \texttt{LIVEditor} , a novel lightning video editing model via ISA and a proposed video-editing data pipeline that curated a 1.7M high-quality dataset. Extensive experiments demonstrate that LIVEditor achieves a sim60% reduction in attention-module latency while surpassing state-of-the-art methods across EditVerseBench, IVE-Bench, and VIE-Bench, delivering near-lossless acceleration without compromising visual fidelity.