Модели генерации видео являются универсальными визуальными обучающимися моделями.

Video Generation Models are General-Purpose Vision Learners

July 10, 2026
Авторы: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu
cs.AI

Аннотация

Движимое предсказанием следующего токена, NLP перешло от специализированных моделей к мощным универсальным фундаментальным моделям. Каков же эквивалентный катализатор, необходимый для создания универсальной модели в компьютерном зрении? В данной работе мы утверждаем, что крупномасштабная генерация видео по тексту служит мощной парадигмой предобучения для компьютерного зрения, предоставляя пространственно-временные априорные знания, выравнивание визуально-языковых представлений и масштабируемость, необходимые для общего визуального интеллекта. Мы представляем GenCeption, которая использует предобученный диффузионный бэкбон для генерации видео, чтобы определить прямую модель восприятия, способную выполнять различные задачи зрения, управляемые текстовыми инструкциями. Эмпирические результаты демонстрируют, что GenCeption достигает современного уровня производительности в широком спектре задач, включая оценку глубины, нормалей поверхности и позы камеры, сегментацию по выражениям и прогнозирование 3D-ключевых точек, часто сравниваясь или превосходя специализированные модели (например, DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo и Lotus-2). Кроме того, предобученный генерацией видео бэкбон превосходит альтернативные парадигмы предобучения (например, V-JEPA и Video MAE) в сопоставимых условиях. Важно отметить, что GenCeption демонстрирует предварительные свойства масштабирования данных и модели, а также исключительную эффективность по данным, достигая сопоставимой производительности с ведущими моделями, такими как D4RT и VGGT-Omega, при наличии от 7 до 500 раз меньшего объёма обучающих данных. Наконец, GenCeption также проявляет интригующее эмерджентное поведение: модель, обученная исключительно на синтетических видео с людьми, обобщается на реальные кадры и категории объектов, выходящие за пределы распределения (например, животные и роботы). Эти результаты свидетельствуют о том, что генерация видео — это не просто инструмент синтеза, а фундаментальный путь к созданию универсального зрительного интеллекта для физического мира. Страница проекта: https://genception.github.io
English
Driven by next-token prediction, NLP shifted from task-specific models into powerful generalist foundation models. What, then, is the equivalent catalyst needed to achieve a general-purpose model in computer vision? In this paper, we contend that large-scale text-to-video generation serves as a strong pre-training paradigm for computer vision, providing the necessary spatiotemporal priors, vision-language alignment, and scalability required for general visual intelligence. We introduce GenCeption, which leverages a pre-trained video generative diffusion backbone to define a feed-forward perception model, capable of performing various vision tasks steered by text instructions. Empirical results demonstrate that GenCeption achieves state-of-the-art performance across a diverse suite of tasks, including depth, surface normal, and camera pose estimation, expression-referring segmentation, and 3D keypoint prediction, often matching or surpassing specialized models (e.g. DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo, and Lotus-2). Furthermore, the video generative pretrained backbone outperforms alternative pretraining paradigms (e.g., V-JEPA, and Video MAE) under comparable settings. Importantly, GenCeption exhibits preliminary data and model scaling properties along with exceptional data efficiency, where it achieves comparable performance with leading models like D4RT and VGGT-Omega with 7 to 500 less training data. Finally, GenCeption also exhibits intriguing emergent behaviors: a model trained exclusively on synthetic human videos generalizes to real-world footage and out-of-distribution object categories (e.g., animals and robots). These findings suggest that video generation is not merely a synthesis tool, but a foundational path toward generalist vision intelligence for the physical world. Project page: https://genception.github.io
PDF400July 14, 2026