Videogeneratiemodellen zijn algemeen toepasbare visuele leerders
Video Generation Models are General-Purpose Vision Learners
July 10, 2026
Auteurs: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu
cs.AI
Samenvatting
Gedreven door de voorspelling van het volgende token verschoof NLP van taakspecifieke modellen naar krachtige generalistische funderingsmodellen. Wat is dan de equivalente katalysator die nodig is om een algemeen toepasbaar model in computervisie te bereiken? In dit artikel stellen wij dat grootschalige tekst-naar-video generatie dient als een sterke voorbereidende trainingsparadigma voor computervisie, die de noodzakelijke spatiotemporele voorkennis, visie-taal afstemming en schaalbaarheid biedt die vereist zijn voor algemene visuele intelligentie. We introduceren GenCeption, dat gebruikmaakt van een voorgetrainde video-generatieve diffusie-backbone om een feed-forward perceptiemodel te definiëren, dat in staat is om diverse visietaken uit te voeren, gestuurd door tekstinstructies. Empirische resultaten tonen aan dat GenCeption state-of-the-art prestaties levert op een breed scala aan taken, waaronder diepte-, oppervlaktenormaal- en camerapositieschatting, expressie-verwijzende segmentatie en 3D-sleutelpuntvoorspelling, waarbij het vaak gespecialiseerde modellen evenaart of overtreft (bijv. DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo en Lotus-2). Bovendien presteert de voorgetrainde video-generatieve backbone beter dan alternatieve trainingsparadigma's (bijv. V-JEPA en Video MAE) onder vergelijkbare omstandigheden. Belangrijk is dat GenCeption voorlopige data- en modelschaaleigenschappen vertoont, samen met uitzonderlijke data-efficiëntie, waarbij het vergelijkbare prestaties bereikt als toonaangevende modellen zoals D4RT en VGGT-Omega met 7 tot 500 keer minder trainingsdata. Tot slot vertoont GenCeption ook intrigerend opkomend gedrag: een model dat uitsluitend is getraind op synthetische menselijke video's generaliseert naar echte beelden en objectcategorieën buiten de verdeling (bijv. dieren en robots). Deze bevindingen suggereren dat videogeneratie niet alleen een synthesetool is, maar een fundamentele weg naar generalistische visie-intelligentie voor de fysieke wereld. Projectpagina: https://genception.github.io
English
Driven by next-token prediction, NLP shifted from task-specific models into powerful generalist foundation models. What, then, is the equivalent catalyst needed to achieve a general-purpose model in computer vision? In this paper, we contend that large-scale text-to-video generation serves as a strong pre-training paradigm for computer vision, providing the necessary spatiotemporal priors, vision-language alignment, and scalability required for general visual intelligence. We introduce GenCeption, which leverages a pre-trained video generative diffusion backbone to define a feed-forward perception model, capable of performing various vision tasks steered by text instructions. Empirical results demonstrate that GenCeption achieves state-of-the-art performance across a diverse suite of tasks, including depth, surface normal, and camera pose estimation, expression-referring segmentation, and 3D keypoint prediction, often matching or surpassing specialized models (e.g. DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo, and Lotus-2). Furthermore, the video generative pretrained backbone outperforms alternative pretraining paradigms (e.g., V-JEPA, and Video MAE) under comparable settings. Importantly, GenCeption exhibits preliminary data and model scaling properties along with exceptional data efficiency, where it achieves comparable performance with leading models like D4RT and VGGT-Omega with 7 to 500 less training data. Finally, GenCeption also exhibits intriguing emergent behaviors: a model trained exclusively on synthetic human videos generalizes to real-world footage and out-of-distribution object categories (e.g., animals and robots). These findings suggest that video generation is not merely a synthesis tool, but a foundational path toward generalist vision intelligence for the physical world. Project page: https://genception.github.io