ChatPaper.aiChatPaper

LongE2V: Reconstrucción, Predicción e Interpolación de Fotogramas de Video Basadas en Eventos de Horizonte Largo con Modelos de Difusión de Video

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

July 9, 2026
Autores: Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu
cs.AI

Resumen

Recuperar video de alta calidad a partir de flujos de eventos dispersos es una tarea desafiante. Los métodos de regresión suelen difuminar texturas, mientras que los modelos generativos existentes tienen dificultades con la estabilidad a largo plazo. Proponemos LongE2V, un enfoque novedoso que aprovecha prioridades de difusión de video preentrenadas para gestionar de forma conjunta la reconstrucción, predicción e interpolación de fotogramas basadas en eventos. Al ajustar finamente un modelo de video fundamental, nuestro enfoque logra una alta eficiencia de datos y una calidad perceptual superior. Introducimos el Desenrollado Autorregresivo y el Cambio de Contexto Adaptativo para mitigar la deriva temporal en secuencias extremadamente largas. También proponemos la Alineación por Re-codificación con Corrección Residual Cruzada para garantizar una consistencia bidireccional precisa durante la interpolación de fotogramas. Además, el Aumento de Densidad de Vóxeles de Eventos asegura robustez frente a diferentes resoluciones de sensores. Experimentos exhaustivos en puntos de referencia del mundo real demuestran que LongE2V supera a los métodos de última generación en las tres tareas, exhibiendo una coherencia temporal excepcional y generalización de cero disparos. Página del proyecto: https://cdfan0627.github.io/LongE2V-page/
English
Recovering high-quality video from sparse event streams is a challenging task. Regression methods often blur textures, while existing generative models struggle with long-term stability. We propose LongE2V, a novel approach that leverages pre-trained video diffusion priors to jointly handle event-based video reconstruction, prediction, and frame interpolation. By fine-tuning a foundational video model, our approach achieves high data efficiency and superior perceptual quality. We introduce Autoregressive Unrolling and Adaptive Context Switching to mitigate temporal drift in extremely long sequences. We also propose Reencoding Alignment with Cross Residual Correction to ensure precise bidirectional consistency during frame interpolation. Furthermore, Event Voxel Density Augmentation ensures robustness across varying sensor resolutions. Extensive experiments on real-world benchmarks demonstrate that LongE2V outperforms state-of-the-art methods across all three tasks, exhibiting exceptional temporal coherence and zero-shot generalization. Project page: https://cdfan0627.github.io/LongE2V-page/