Los modelos de generación de video son aprendices de visión de propósito general

Video Generation Models are General-Purpose Vision Learners

July 10, 2026
Autores: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu
cs.AI

Resumen

Impulsada por la predicción del siguiente token, la PNL pasó de modelos específicos para tareas a modelos fundacionales generalistas y potentes. ¿Cuál es, entonces, el catalizador equivalente necesario para lograr un modelo de propósito general en visión artificial? En este artículo, sostenemos que la generación de texto a vídeo a gran escala constituye un sólido paradigma de preentrenamiento para la visión artificial, proporcionando los priors espacio-temporales, la alineación visión-lenguaje y la escalabilidad necesarias para una inteligencia visual general. Presentamos GenCeption, que aprovecha un backbone generativo de difusión de vídeo preentrenado para definir un modelo de percepción por propagación hacia adelante, capaz de realizar diversas tareas visuales guiadas por instrucciones de texto. Los resultados empíricos demuestran que GenCeption alcanza un rendimiento de vanguardia en un conjunto diverso de tareas, incluyendo estimación de profundidad, normales de superficie y pose de cámara, segmentación por referencia a expresiones y predicción de puntos clave 3D, igualando o superando a menudo a modelos especializados (por ejemplo, DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo y Lotus-2). Además, el backbone preentrenado para generación de vídeo supera a paradigmas de preentrenamiento alternativos (por ejemplo, V-JEPA y Video MAE) en condiciones comparables. Es importante destacar que GenCeption muestra propiedades preliminares de escalado de datos y modelos, junto con una eficiencia de datos excepcional, logrando un rendimiento comparable al de modelos líderes como D4RT y VGGT-Omega con entre 7 y 500 veces menos datos de entrenamiento. Finalmente, GenCeption también exhibe comportamientos emergentes intrigantes: un modelo entrenado exclusivamente con vídeos humanos sintéticos se generaliza a imágenes reales y a categorías de objetos fuera de la distribución (por ejemplo, animales y robots). Estos hallazgos sugieren que la generación de vídeo no es meramente una herramienta de síntesis, sino un camino fundacional hacia la inteligencia visual generalista para el mundo físico. Página del proyecto: https://genception.github.io
English
Driven by next-token prediction, NLP shifted from task-specific models into powerful generalist foundation models. What, then, is the equivalent catalyst needed to achieve a general-purpose model in computer vision? In this paper, we contend that large-scale text-to-video generation serves as a strong pre-training paradigm for computer vision, providing the necessary spatiotemporal priors, vision-language alignment, and scalability required for general visual intelligence. We introduce GenCeption, which leverages a pre-trained video generative diffusion backbone to define a feed-forward perception model, capable of performing various vision tasks steered by text instructions. Empirical results demonstrate that GenCeption achieves state-of-the-art performance across a diverse suite of tasks, including depth, surface normal, and camera pose estimation, expression-referring segmentation, and 3D keypoint prediction, often matching or surpassing specialized models (e.g. DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo, and Lotus-2). Furthermore, the video generative pretrained backbone outperforms alternative pretraining paradigms (e.g., V-JEPA, and Video MAE) under comparable settings. Importantly, GenCeption exhibits preliminary data and model scaling properties along with exceptional data efficiency, where it achieves comparable performance with leading models like D4RT and VGGT-Omega with 7 to 500 less training data. Finally, GenCeption also exhibits intriguing emergent behaviors: a model trained exclusively on synthetic human videos generalizes to real-world footage and out-of-distribution object categories (e.g., animals and robots). These findings suggest that video generation is not merely a synthesis tool, but a foundational path toward generalist vision intelligence for the physical world. Project page: https://genception.github.io
PDF400July 14, 2026