LongE2V : Reconstruction, prédiction et interpolation d’images de vidéos basées sur les événements à long horizon à l’aide de modèles de diffusion vidéo
LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models
July 9, 2026
Auteurs: Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu
cs.AI
Résumé
Récupérer des vidéos de haute qualité à partir de flux d'événements clairsemés est une tâche difficile. Les méthodes de régression estompent souvent les textures, tandis que les modèles génératifs existants peinent à assurer une stabilité à long terme. Nous proposons LongE2V, une approche novatrice qui exploite des priors de diffusion vidéo pré-entraînés pour traiter conjointement la reconstruction vidéo basée sur les événements, la prédiction et l'interpolation d'images. En ajustant finement un modèle vidéo fondamental, notre approche atteint une efficacité élevée en termes de données et une qualité perceptuelle supérieure. Nous introduisons le déroulement autorégressif et la commutation adaptative du contexte pour atténuer la dérive temporelle dans les séquences extrêmement longues. Nous proposons également l'alignement de réencodage avec correction résiduelle croisée pour garantir une cohérence bidirectionnelle précise lors de l'interpolation d'images. De plus, l'augmentation de la densité des voxels d'événements assure une robustesse pour différentes résolutions de capteurs. Des expériences approfondies sur des bancs d'essai du monde réel montrent que LongE2V surpasse les méthodes de pointe pour les trois tâches, présentant une cohérence temporelle exceptionnelle et une généralisation zero-shot. Page du projet : https://cdfan0627.github.io/LongE2V-page/
English
Recovering high-quality video from sparse event streams is a challenging task. Regression methods often blur textures, while existing generative models struggle with long-term stability. We propose LongE2V, a novel approach that leverages pre-trained video diffusion priors to jointly handle event-based video reconstruction, prediction, and frame interpolation. By fine-tuning a foundational video model, our approach achieves high data efficiency and superior perceptual quality. We introduce Autoregressive Unrolling and Adaptive Context Switching to mitigate temporal drift in extremely long sequences. We also propose Reencoding Alignment with Cross Residual Correction to ensure precise bidirectional consistency during frame interpolation. Furthermore, Event Voxel Density Augmentation ensures robustness across varying sensor resolutions. Extensive experiments on real-world benchmarks demonstrate that LongE2V outperforms state-of-the-art methods across all three tasks, exhibiting exceptional temporal coherence and zero-shot generalization. Project page: https://cdfan0627.github.io/LongE2V-page/