LongE2V: Langetermijn op gebeurtenissen gebaseerde videoreconstructie, voorspelling en frame-interpolatie met videodiffusiemodellen
LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models
July 9, 2026
Auteurs: Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu
cs.AI
Samenvatting
Het herstellen van hoogwaardige video uit schaarse gebeurtenisstromen is een uitdagende taak. Regressiemethoden vervagen vaak texturen, terwijl bestaande generatieve modellen moeite hebben met stabiliteit op lange termijn. Wij stellen LongE2V voor, een nieuwe aanpak die gebruikmaakt van voorgetrainde videodiffusiepriors om gezamenlijk op gebeurtenissen gebaseerde videoreconstructie, voorspelling en frame-interpolatie aan te pakken. Door het finetunen van een fundamenteel videomodel bereikt onze aanpak een hoge data-efficiëntie en superieure perceptuele kwaliteit. We introduceren Autoregressief Uitrollen en Adaptieve Contextomschakeling om temporele drift in extreem lange sequenties te beperken. Ook stellen we Herencoderingsuitlijning met Kruisresidualcorrectie voor om precieze bidirectionele consistentie tijdens frame-interpolatie te waarborgen. Daarnaast zorgt Gebeurtenisvoxeldichtheidsaugmentatie voor robuustheid bij wisselende sensorresoluties. Uitgebreide experimenten op real-world benchmarks tonen aan dat LongE2V de state-of-the-art methoden overtreft voor alle drie taken, met uitzonderlijke temporele coherentie en zero-shot generalisatie. Projectpagina: https://cdfan0627.github.io/LongE2V-page/
English
Recovering high-quality video from sparse event streams is a challenging task. Regression methods often blur textures, while existing generative models struggle with long-term stability. We propose LongE2V, a novel approach that leverages pre-trained video diffusion priors to jointly handle event-based video reconstruction, prediction, and frame interpolation. By fine-tuning a foundational video model, our approach achieves high data efficiency and superior perceptual quality. We introduce Autoregressive Unrolling and Adaptive Context Switching to mitigate temporal drift in extremely long sequences. We also propose Reencoding Alignment with Cross Residual Correction to ensure precise bidirectional consistency during frame interpolation. Furthermore, Event Voxel Density Augmentation ensures robustness across varying sensor resolutions. Extensive experiments on real-world benchmarks demonstrate that LongE2V outperforms state-of-the-art methods across all three tasks, exhibiting exceptional temporal coherence and zero-shot generalization. Project page: https://cdfan0627.github.io/LongE2V-page/