Vision en tant que génération multimodale unifiée
Vision as Unified Multimodal Generation
July 7, 2026
Auteurs: Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang
cs.AI
Résumé
Nous formulons la vision par ordinateur comme une génération multimodale unifiée, où des tâches visuelles hétérogènes sont exprimées dans les espaces natifs de texte et de génération d'images d'un modèle multimodal unifié, sans architectures spécifiques aux tâches. Sous cette formulation, SenseNova-Vision utilise des instructions en langage naturel et des invites visuelles optionnelles pour spécifier les tâches, les régions ou vues cibles, ainsi que les conventions de décodage, et génère des réponses sous forme de texte pour les sorties symboliques, d'images pour les prédictions spatiales denses, ou de sorties mixtes texte et image pour les tâches compositionnelles. Pour soutenir l'entraînement à grande échelle, nous convertissons diverses annotations de vision par ordinateur en exemples instruction-réponse compatibles avec ces espaces de génération, ce qui donne le Corpus SenseNova-Vision, un corpus d'instructions-réponses en vision par ordinateur couvrant des cibles textuelles, images et mixtes. Partant d'un modèle multimodal unifié pré-entraîné disponible dans le commerce, SenseNova-Vision est principalement entraîné sur ce corpus, avec des données multimodales auxiliaires utilisées comme mélange préservant les capacités, et ne nécessite ni têtes de prédiction spécifiques aux tâches ni modifications architecturales. Le modèle obtenu couvre un large éventail de tâches visuelles, notamment la détection, la reconnaissance optique de caractères (OCR), l'estimation de points clés, la segmentation, l'estimation de profondeur, la prédiction de normales de surface, les cartes de points et l'estimation de pose de caméra, tout en prenant en charge des variantes définies par le langage qui combinent la catégorie, la couleur, la région et d'autres indices visuels. Les expériences montrent qu'un seul modèle unifié peut égaler les principaux systèmes spécialisés dans la compréhension structurée visuelle, la prédiction géométrique dense, la segmentation et la géométrie visuelle multi-vues. Ces résultats suggèrent que la génération multimodale unifiée constitue une voie évolutive pour intégrer les capacités de vision par ordinateur dans les modèles de base à usage général. Le modèle et le corpus sont disponibles publiquement.
English
We formulate computer vision as unified multimodal generation, where heterogeneous visual tasks are expressed in the native text and image generation spaces of a unified multimodal model, without task-specific architectures. Under this formulation, SenseNova-Vision uses natural-language instructions and optional visual prompts to specify tasks, target regions or views, and decoding conventions, and generates responses as text for symbolic outputs, images for dense spatial predictions, or mixed text-and-image outputs for compositional tasks. To support large-scale training, we convert diverse computer vision annotations into instruction-response examples compatible with these generation spaces, resulting in the SenseNova-Vision Corpus, a computer-vision instruction-response corpus spanning text, image, and mixed targets. Starting from an off-the-shelf pretrained unified multimodal model, SenseNova-Vision is trained primarily on this corpus, with auxiliary multimodal data used as a capability-preserving mixture, and requires no task-specific prediction heads or architectural modifications. The resulting model covers a broad range of vision tasks, including detection, OCR, keypoint estimation, segmentation, depth estimation, surface normal prediction, point maps, and camera pose estimation, while supporting language-defined variants that combine category, color, region, and other visual cues. Experiments show that a single unified model can match leading task-specialized systems across structured visual understanding, dense geometric prediction, segmentation, and multi-view visual geometry. These results suggest unified multimodal generation as a scalable route for integrating computer vision capabilities into general-purpose foundation models. The model and corpus are publicly available.