TrackCraft3R : Réaffectation des Transformateurs de Diffusion Vidéo pour le Suivi 3D Dense
TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking
May 12, 2026
Auteurs: Jisu Nam, Jahyeok Koo, Soowon Son, Jaewoo Jung, Honggyu An, Junhwa Hur, Seungryong Kim
cs.AI
Résumé
Le suivi 3D dense à partir d'une vidéo monoculaire est fondamental pour la compréhension de scènes dynamiques. Alors que les récents modèles 3D fondamentaux fournissent une géométrie fiable par image, la récupération du mouvement des objets dans cette géométrie reste difficile et bénéficie de fortes contraintes de mouvement apprises à partir de vidéos réelles. Les trajectographes 3D existants suivent soit des paradigmes itératifs entraînés à partir de zéro sur des données synthétiques, soit affinent des modèles de reconstruction 3D appris à partir d'images multi-vues statiques, les deux manquant de contraintes de mouvement issues du monde réel. Les transformateurs de diffusion vidéo pré-entraînés (video DiTs) offrent de riches contraintes spatio-temporelles à partir de vidéos à l'échelle d'Internet, ce qui en fait une base prometteuse pour le suivi 3D. Cependant, leur formulation ancrée sur l'image, qui génère le contenu de chaque image, est fondamentalement incompatible avec le suivi 3D dense ancré sur la référence, qui doit suivre les mêmes points physiques à partir d'une image de référence à travers le temps. Nous présentons TrackCraft3R, la première méthode à réutiliser un video DiT comme trajectographe 3D dense feed-forward. Étant donné une vidéo monoculaire et sa carte de points de reconstruction ancrée sur l'image, TrackCraft3R prédit une carte de points de suivi ancrée sur la référence qui suit chaque pixel de la première image à travers le temps en un seul passage avant, ainsi que sa visibilité. Nous y parvenons grâce à deux conceptions : (i) une représentation à double latent qui utilise des latents de géométrie par image et des latents de trajectoire ancrés sur la référence comme requêtes denses, et (ii) un alignement temporel RoPE, qui spécifie l'horodatage cible de chaque latent de trajectoire. Ensemble, ces conceptions convertissent le paradigme génératif par image des video DiTs en une formulation de suivi ancrée sur la référence avec un fine-tuning LoRA. TrackCraft3R atteint des performances de pointe sur les benchmarks standards de suivi 3D dense et parcimonieux, tout en étant 1,3 fois plus rapide et en utilisant 4,6 fois moins de mémoire de pointe que la méthode antérieure la plus performante. Nous démontrons en outre sa robustesse face aux grands mouvements et aux longues vidéos.
English
Dense 3D tracking from monocular video is fundamental to dynamic scene understanding. While recent 3D foundation models provide reliable per-frame geometry, recovering object motion in this geometry remains challenging and benefits from strong motion priors learned from real-world videos. Existing 3D trackers either follow iterative paradigms trained from scratch on synthetic data or fine-tune 3D reconstruction models learned from static multi-view images, both lacking real-world motion priors. Pre-trained video diffusion transformers (video DiTs) offer rich spatio-temporal priors from internet-scale videos, making them a promising foundation for 3D tracking. However, their frame-anchored formulation, which generates each frame's content, is fundamentally mismatched with reference-anchored dense 3D tracking, which must follow the same physical points from a reference frame across time. We present TrackCraft3R, the first method to repurpose a video DiT as a feed-forward dense 3D tracker. Given a monocular video and its frame-anchored reconstruction pointmap, TrackCraft3R predicts a reference-anchored tracking pointmap that follows every pixel of the first frame across time in a single forward pass, along with its visibility. We achieve this through two designs: (i) a dual-latent representation that uses per-frame geometry latents and reference-anchored track latents as dense queries, and (ii) temporal RoPE alignment, which specifies the target timestamp of each track latent. Together, these designs convert the per-frame generative paradigm of video DiTs into a reference-anchored tracking formulation with LoRA fine-tuning. TrackCraft3R achieves state-of-the-art performance on standard sparse and dense 3D tracking benchmarks, while running 1.3x faster and using 4.6x less peak memory than the strongest prior method. We further demonstrate robustness to large motions and long videos.