Les modèles de génération vidéo sont des apprenants visuels polyvalents
Video Generation Models are General-Purpose Vision Learners
July 10, 2026
Auteurs: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu
cs.AI
Résumé
Propulsé par la prédiction du prochain jeton, le TALN est passé de modèles spécifiques à des tâches à de puissants modèles fondamentaux généralistes. Quel est, alors, le catalyseur équivalent nécessaire pour parvenir à un modèle à usage général en vision par ordinateur ? Dans cet article, nous soutenons que la génération de texte vers vidéo à grande échelle constitue un paradigme de pré-entraînement solide pour la vision par ordinateur, fournissant les priors spatiotemporels, l'alignement vision-langage et l'évolutivité nécessaires à une intelligence visuelle générale. Nous présentons GenCeption, qui exploite un backbone de diffusion générative vidéo pré-entraîné pour définir un modèle perceptif en flux continu, capable d'effectuer diverses tâches visuelles guidées par des instructions textuelles. Les résultats empiriques montrent que GenCeption atteint des performances de pointe sur un ensemble diversifié de tâches, notamment l'estimation de profondeur, de normales de surface et de pose de caméra, la segmentation par référence d'expression et la prédiction de points clés 3D, égalant ou surpassant souvent des modèles spécialisés (par exemple, DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo et Lotus-2). De plus, le backbone pré-entraîné génératif vidéo surpasse les paradigmes de pré-entraînement alternatifs (par exemple, V-JEPA et Video MAE) dans des configurations comparables. Fait important, GenCeption présente des propriétés d'évolutivité préliminaires en matière de données et de modèle, ainsi qu'une efficacité exceptionnelle en matière de données, atteignant des performances comparables à celles de modèles de premier plan comme D4RT et VGGT-Omega avec 7 à 500 fois moins de données d'entraînement. Enfin, GenCeption manifeste également des comportements émergents intrigants : un modèle entraîné exclusivement sur des vidéos humaines synthétiques se généralise à des séquences du monde réel et à des catégories d'objets hors distribution (par exemple, animaux et robots). Ces résultats suggèrent que la génération vidéo n'est pas simplement un outil de synthèse, mais une voie fondamentale vers une intelligence visuelle généraliste pour le monde physique. Page du projet : https://genception.github.io
English
Driven by next-token prediction, NLP shifted from task-specific models into powerful generalist foundation models. What, then, is the equivalent catalyst needed to achieve a general-purpose model in computer vision? In this paper, we contend that large-scale text-to-video generation serves as a strong pre-training paradigm for computer vision, providing the necessary spatiotemporal priors, vision-language alignment, and scalability required for general visual intelligence. We introduce GenCeption, which leverages a pre-trained video generative diffusion backbone to define a feed-forward perception model, capable of performing various vision tasks steered by text instructions. Empirical results demonstrate that GenCeption achieves state-of-the-art performance across a diverse suite of tasks, including depth, surface normal, and camera pose estimation, expression-referring segmentation, and 3D keypoint prediction, often matching or surpassing specialized models (e.g. DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo, and Lotus-2). Furthermore, the video generative pretrained backbone outperforms alternative pretraining paradigms (e.g., V-JEPA, and Video MAE) under comparable settings. Importantly, GenCeption exhibits preliminary data and model scaling properties along with exceptional data efficiency, where it achieves comparable performance with leading models like D4RT and VGGT-Omega with 7 to 500 less training data. Finally, GenCeption also exhibits intriguing emergent behaviors: a model trained exclusively on synthetic human videos generalizes to real-world footage and out-of-distribution object categories (e.g., animals and robots). These findings suggest that video generation is not merely a synthesis tool, but a foundational path toward generalist vision intelligence for the physical world. Project page: https://genception.github.io