ChatPaper.aiChatPaper

A^2RD: Difusão Autoregressiva Agêntica para Consistência de Vídeos Longos

A^2RD: Agentic Autoregressive Diffusion for Long Video Consistency

May 7, 2026
Autores: Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le
cs.AI

Resumo

Sintetizar vídeos longos consistentes e coerentes continua sendo um desafio fundamental. Os métodos existentes sofrem de deriva semântica e colapso narrativo em horizontes longos. Apresentamos o A²RD, uma arquitetura de Difusão Autoregressiva Agencial que desacopla a síntese criativa da aplicação de consistência. O A²RD formula a síntese de vídeos longos como um processo em malha fechada que sintetiza e melhora automaticamente o vídeo segmento por segmento por meio de um ciclo de Recuperação–Síntese–Refinamento–Atualização. Ele compreende três componentes principais: (i) Memória de Vídeo Multimodal, que acompanha a progressão do vídeo entre modalidades; (ii) Geração Adaptativa de Segmentos, que alterna entre modos de geração para progressão natural e consistência visual; e (iii) Autoaperfeiçoamento Hierárquico em Tempo de Teste, que melhora cada segmento nos níveis de quadro e vídeo para evitar a propagação de erros. Introduzimos ainda o LVBench-C, um benchmark desafiador com transições não lineares de entidades e ambientes para testar a consistência em horizontes longos. Em benchmarks públicos e no LVBench-C, abrangendo vídeos de um a dez minutos, o A²RD supera as linhas de base do estado da arte em até 30% em consistência e 20% em coerência narrativa. Avaliações humanas corroboram esses ganhos, destacando também melhorias notáveis na suavidade de movimento e transição.
English
Synthesizing consistent and coherent long video remains a fundamental challenge. Existing methods suffer from semantic drift and narrative collapse over long horizons. We present A^2RD, an Agentic Auto-Regressive Diffusion architecture that decouples creative synthesis from consistency enforcement. A^2RD formulates long video synthesis as a closed-loop process that synthesizes and self-improves video segment-by-segment through a Retrieve--Synthesize--Refine--Update cycle. It comprises three core components: (i) Multimodal Video Memory that tracks video progression across modalities; (ii) Adaptive Segment Generation that switches among generation modes for natural progression and visual consistency; and (iii) Hierarchical Test-Time Self-Improvement that self-improves each segment at frame and video levels to prevent error propagation. We further introduce LVBench-C, a challenging benchmark with non-linear entity and environment transitions to stress-test long-horizon consistency. Across public and LVBench-C benchmarks spanning one- to ten-minute videos, A^2RD outperforms state-of-the-art baselines by up to 30% in consistency and 20% in narrative coherence. Human evaluations corroborate these gains while also highlighting notable improvements in motion and transition smoothness.