MVTrack4Gen: Rastreamento de Pontos em Múltiplas Visões como Supervisão Geométrica para Geração de Vídeo 4D
MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation
June 24, 2026
Autores: JoungBin Lee, Jaewoo Jung, Jongmin Lee, Tongmin Kim, Hyunsung Kim, Takuya Narihira, Kazumi Fukuda, Jahyeok Koo, Jisang Han, Yuki Mitsufuji, Seungryong Kim
cs.AI
Resumo
Sintetizar um vídeo de nova vista a partir de um vídeo de referência monocular ao longo de uma trajetória de câmera alvo requer tanto consistência geométrica quanto fidelidade de movimento em relação ao vídeo de referência. Métodos existentes baseados em representações 3D explícitas são limitados pela precisão de módulos de reconstrução prontos para uso, que frequentemente produzem geometria imprecisa para objetos dinâmicos em vídeos monoculares. Em contraste, métodos que condicionam apenas a câmera podem alcançar alta qualidade visual, mas frequentemente têm dificuldade em preservar a consistência geométrica e de movimento. Neste trabalho, introduzimos o MVTrack4Gen (Rastreamento de Pontos Multi-Vista para Geração de Nova Vista), uma estrutura de treinamento ciente de movimento que utiliza o rastreamento de pontos multi-vista como um sinal de supervisão geométrica e de movimento adicional para modelos de difusão de vídeo de nova vista que condicionam apenas a câmera. Nossa principal descoberta é que camadas de atenção específicas codificam fortes pistas de correspondência, onde características de consulta atendem a características-chave em localizações geometricamente correspondentes entre vistas e ao longo do tempo, e o desalinhamento dessas correspondências causa inconsistência de movimento. Com base nessa observação, roteamos essas características para uma cabeça auxiliar de rastreamento multi-vista e treinamos conjuntamente o modelo de difusão com um objetivo de rastreamento de pontos. Ao fortalecer explicitamente essas correspondências cientes de movimento, o MVTrack4Gen melhora modelos existentes para seguir melhor o movimento na vista de referência e manter a consistência geométrica entre vistas. Em diversos benchmarks, nosso método alcança consistência geométrica de ponta e precisão de câmera competitiva.
English
Synthesizing a novel-view video from a monocular reference video along a target camera trajectory requires both geometric consistency and motion fidelity with respect to the reference video. Existing methods based on explicit 3D representations are limited by the accuracy of off-the-shelf reconstruction modules, which often produce inaccurate geometry for dynamic objects in monocular videos. In contrast, camera-conditioning-only methods can achieve high visual quality but often struggle to preserve geometric and motion consistency. In this work, we introduce MVTrack4Gen (Multi-View point Tracking for Novel-View Generation), a motion-aware training framework that leverages multi-view point tracking as an additional geometric and motion supervision signal for camera-conditioning-only novel-view video diffusion models. Our key finding is that specific attention layers encode strong correspondence cues, where query features attend to key features at geometrically corresponding locations across views and over time, and the misalignment of these correspondences causes motion inconsistency. Based on this observation, we route these features into an auxiliary multi-view tracking head and jointly train the diffusion model with a point-tracking objective. By explicitly strengthening these motion-aware correspondences, MVTrack4Gen improves existing models to better follow the motion in the reference view and maintain cross-view geometric consistency. Across diverse benchmarks, our method achieves state-of-the-art geometric consistency and competitive camera accuracy.