ChatPaper.aiChatPaper

LongE2V: Reconstrução, Predição e Interpolação de Quadros de Vídeo Baseados em Eventos com Horizonte Longo usando Modelos de Difusão de Vídeo

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

July 9, 2026
Autores: Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu
cs.AI

Resumo

Recuperar vídeos de alta qualidade a partir de fluxos de eventos esparsos é uma tarefa desafiadora. Métodos de regressão frequentemente borram texturas, enquanto modelos generativos existentes enfrentam dificuldades com estabilidade de longo prazo. Propomos LongE2V, uma abordagem inovadora que utiliza priores de difusão de vídeo pré-treinados para lidar conjuntamente com reconstrução, predição e interpolação de quadros baseadas em eventos. Ao ajustar finamente um modelo fundamental de vídeo, nossa abordagem alcança alta eficiência de dados e qualidade perceptual superior. Introduzimos Desenrolamento Autorregressivo e Comutação Adaptativa de Contexto para mitigar a deriva temporal em sequências extremamente longas. Propomos também Alinhamento com Re-codificação via Correção Residual Cruzada para garantir consistência bidirecional precisa durante a interpolação de quadros. Além disso, o Aumento de Densidade de Voxels de Eventos assegura robustez em diferentes resoluções de sensores. Experimentos extensivos em benchmarks do mundo real demonstram que LongE2V supera métodos estado-da-arte em todas as três tarefas, exibindo coerência temporal excepcional e generalização zero-shot. Página do projeto: https://cdfan0627.github.io/LongE2V-page/
English
Recovering high-quality video from sparse event streams is a challenging task. Regression methods often blur textures, while existing generative models struggle with long-term stability. We propose LongE2V, a novel approach that leverages pre-trained video diffusion priors to jointly handle event-based video reconstruction, prediction, and frame interpolation. By fine-tuning a foundational video model, our approach achieves high data efficiency and superior perceptual quality. We introduce Autoregressive Unrolling and Adaptive Context Switching to mitigate temporal drift in extremely long sequences. We also propose Reencoding Alignment with Cross Residual Correction to ensure precise bidirectional consistency during frame interpolation. Furthermore, Event Voxel Density Augmentation ensures robustness across varying sensor resolutions. Extensive experiments on real-world benchmarks demonstrate that LongE2V outperforms state-of-the-art methods across all three tasks, exhibiting exceptional temporal coherence and zero-shot generalization. Project page: https://cdfan0627.github.io/LongE2V-page/