ChatPaper.aiChatPaper

Modelos de Geração de Vídeos são Aprendizes de Visão de Propósito Geral

Video Generation Models are General-Purpose Vision Learners

July 10, 2026
Autores: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu
cs.AI

Resumo

Impulsionada pela previsão do próximo token, a PNL evoluiu de modelos específicos para tarefas para modelos fundamentais generalistas poderosos. Qual seria, então, o catalisador equivalente necessário para alcançar um modelo de propósito geral em visão computacional? Neste artigo, defendemos que a geração de texto para vídeo em larga escala constitui um paradigma de pré-treinamento robusto para visão computacional, fornecendo os priors espaço-temporais, o alinhamento visão-linguagem e a escalabilidade necessários para uma inteligência visual geral. Apresentamos o GenCeption, que utiliza uma espinha dorsal generativa de difusão de vídeo pré-treinada para definir um modelo de percepção feed-forward, capaz de realizar diversas tarefas visuais orientadas por instruções textuais. Resultados empíricos demonstram que o GenCeption alcança desempenho de ponta em um conjunto diversificado de tarefas, incluindo estimativa de profundidade, normais de superfície e pose de câmera, segmentação referida por expressão e previsão de pontos-chave 3D, frequentemente igualando ou superando modelos especializados (por exemplo, DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo e Lotus-2). Além disso, a espinha dorsal pré-treinada generativa de vídeo supera paradigmas alternativos de pré-treinamento (por exemplo, V-JEPA e Video MAE) sob configurações comparáveis. De forma importante, o GenCeption exibe propriedades preliminares de escala de dados e modelo, juntamente com eficiência excepcional de dados, alcançando desempenho comparável ao de modelos líderes como D4RT e VGGT-Omega com 7 a 500 vezes menos dados de treinamento. Por fim, o GenCeption também exibe comportamentos emergentes intrigantes: um modelo treinado exclusivamente em vídeos humanos sintéticos generaliza para imagens do mundo real e categorias de objetos fora da distribuição (por exemplo, animais e robôs). Essas descobertas sugerem que a geração de vídeo não é meramente uma ferramenta de síntese, mas um caminho fundamental para a inteligência visual generalista no mundo físico. Página do projeto: https://genception.github.io
English
Driven by next-token prediction, NLP shifted from task-specific models into powerful generalist foundation models. What, then, is the equivalent catalyst needed to achieve a general-purpose model in computer vision? In this paper, we contend that large-scale text-to-video generation serves as a strong pre-training paradigm for computer vision, providing the necessary spatiotemporal priors, vision-language alignment, and scalability required for general visual intelligence. We introduce GenCeption, which leverages a pre-trained video generative diffusion backbone to define a feed-forward perception model, capable of performing various vision tasks steered by text instructions. Empirical results demonstrate that GenCeption achieves state-of-the-art performance across a diverse suite of tasks, including depth, surface normal, and camera pose estimation, expression-referring segmentation, and 3D keypoint prediction, often matching or surpassing specialized models (e.g. DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo, and Lotus-2). Furthermore, the video generative pretrained backbone outperforms alternative pretraining paradigms (e.g., V-JEPA, and Video MAE) under comparable settings. Importantly, GenCeption exhibits preliminary data and model scaling properties along with exceptional data efficiency, where it achieves comparable performance with leading models like D4RT and VGGT-Omega with 7 to 500 less training data. Finally, GenCeption also exhibits intriguing emergent behaviors: a model trained exclusively on synthetic human videos generalizes to real-world footage and out-of-distribution object categories (e.g., animals and robots). These findings suggest that video generation is not merely a synthesis tool, but a foundational path toward generalist vision intelligence for the physical world. Project page: https://genception.github.io