Visão como Geração Multimodal Unificada
Vision as Unified Multimodal Generation
July 7, 2026
Autores: Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang
cs.AI
Resumo
Formulamos a visão computacional como geração multimodal unificada, na qual tarefas visuais heterogêneas são expressas nos espaços nativos de geração de texto e imagem de um modelo multimodal unificado, sem arquiteturas específicas para cada tarefa. Sob essa formulação, o SenseNova-Vision utiliza instruções em linguagem natural e dicas visuais opcionais para especificar tarefas, regiões ou vistas-alvo e convenções de decodificação, gerando respostas como texto para saídas simbólicas, imagens para previsões espaciais densas ou saídas mistas de texto e imagem para tarefas composicionais. Para apoiar o treinamento em larga escala, convertemos diversas anotações de visão computacional em exemplos de instrução-resposta compatíveis com esses espaços de geração, resultando no SenseNova-Vision Corpus, um corpus de instrução-resposta de visão computacional que abrange alvos de texto, imagem e mistos. Partindo de um modelo multimodal unificado pré-treinado disponível, o SenseNova-Vision é treinado principalmente nesse corpus, com dados multimodais auxiliares utilizados como uma mistura preservadora de capacidades, não exigindo cabeças de predição específicas para tarefas ou modificações arquiteturais. O modelo resultante cobre uma ampla gama de tarefas de visão, incluindo detecção, OCR, estimativa de pontos-chave, segmentação, estimativa de profundidade, predição de normais de superfície, mapas de pontos e estimativa de pose de câmera, além de suportar variantes definidas por linguagem que combinam categoria, cor, região e outras pistas visuais. Experimentos mostram que um único modelo unificado pode equiparar sistemas especializados líderes em compreensão visual estruturada, predição geométrica densa, segmentação e geometria visual multivista. Esses resultados sugerem que a geração multimodal unificada é uma rota escalável para integrar capacidades de visão computacional em modelos de base de propósito geral. O modelo e o corpus estão disponíveis publicamente.
English
We formulate computer vision as unified multimodal generation, where heterogeneous visual tasks are expressed in the native text and image generation spaces of a unified multimodal model, without task-specific architectures. Under this formulation, SenseNova-Vision uses natural-language instructions and optional visual prompts to specify tasks, target regions or views, and decoding conventions, and generates responses as text for symbolic outputs, images for dense spatial predictions, or mixed text-and-image outputs for compositional tasks. To support large-scale training, we convert diverse computer vision annotations into instruction-response examples compatible with these generation spaces, resulting in the SenseNova-Vision Corpus, a computer-vision instruction-response corpus spanning text, image, and mixed targets. Starting from an off-the-shelf pretrained unified multimodal model, SenseNova-Vision is trained primarily on this corpus, with auxiliary multimodal data used as a capability-preserving mixture, and requires no task-specific prediction heads or architectural modifications. The resulting model covers a broad range of vision tasks, including detection, OCR, keypoint estimation, segmentation, depth estimation, surface normal prediction, point maps, and camera pose estimation, while supporting language-defined variants that combine category, color, region, and other visual cues. Experiments show that a single unified model can match leading task-specialized systems across structured visual understanding, dense geometric prediction, segmentation, and multi-view visual geometry. These results suggest unified multimodal generation as a scalable route for integrating computer vision capabilities into general-purpose foundation models. The model and corpus are publicly available.