ChatPaper.aiChatPaper

LongE2V: долгосрочная событийная реконструкция видео, предсказание и интерполяция кадров с помощью видеодиффузионных моделей

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

July 9, 2026
Авторы: Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu
cs.AI

Аннотация

Восстановление высококачественного видео из разреженных потоков событий является сложной задачей. Регрессионные методы часто размывают текстуры, а существующие генеративные модели страдают от проблем с долговременной стабильностью. Мы предлагаем LongE2V — новый подход, который использует предварительно обученные диффузионные приоры для видео для совместного решения задач реконструкции, предсказания и интерполяции кадров на основе событий. Путем тонкой настройки фундаментальной видео-модели наш подход достигает высокой эффективности использования данных и превосходного перцептивного качества. Мы вводим авторегрессионное развертывание и адаптивное переключение контекста для ослабления временного дрейфа в очень длинных последовательностях. Также предлагается выравнивание с перекодированием и коррекцией перекрестных остатков для обеспечения точной двунаправленной согласованности при интерполяции кадров. Кроме того, аугментация плотности вокселей событий обеспечивает устойчивость к различному разрешению сенсоров. Обширные эксперименты на реальных эталонных наборах данных показывают, что LongE2V превосходит современные методы по всем трем задачам, демонстрируя исключительную временную согласованность и обобщение без обучения. Страница проекта: https://cdfan0627.github.io/LongE2V-page/
English
Recovering high-quality video from sparse event streams is a challenging task. Regression methods often blur textures, while existing generative models struggle with long-term stability. We propose LongE2V, a novel approach that leverages pre-trained video diffusion priors to jointly handle event-based video reconstruction, prediction, and frame interpolation. By fine-tuning a foundational video model, our approach achieves high data efficiency and superior perceptual quality. We introduce Autoregressive Unrolling and Adaptive Context Switching to mitigate temporal drift in extremely long sequences. We also propose Reencoding Alignment with Cross Residual Correction to ensure precise bidirectional consistency during frame interpolation. Furthermore, Event Voxel Density Augmentation ensures robustness across varying sensor resolutions. Extensive experiments on real-world benchmarks demonstrate that LongE2V outperforms state-of-the-art methods across all three tasks, exhibiting exceptional temporal coherence and zero-shot generalization. Project page: https://cdfan0627.github.io/LongE2V-page/