Visión como Generación Multimodal Unificada
Vision as Unified Multimodal Generation
July 7, 2026
Autores: Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang
cs.AI
Resumen
Formulamos la visión por computadora como generación multimodal unificada, donde las tareas visuales heterogéneas se expresan en los espacios nativos de generación de texto e imagen de un modelo multimodal unificado, sin necesidad de arquitecturas específicas para cada tarea. Bajo esta formulación, SenseNova-Vision emplea instrucciones en lenguaje natural y señales visuales opcionales para especificar tareas, regiones objetivo o vistas, así como convenciones de decodificación, y genera respuestas como texto para salidas simbólicas, imágenes para predicciones espaciales densas, o resultados mixtos de texto e imagen para tareas composicionales. Para respaldar el entrenamiento a gran escala, convertimos diversas anotaciones de visión por computadora en ejemplos de instrucción-respuesta compatibles con estos espacios de generación, dando lugar al Corpus SenseNova-Vision, un corpus de instrucción-respuesta de visión por computadora que abarca objetivos de texto, imagen y mixtos. Partiendo de un modelo multimodal unificado preentrenado disponible, SenseNova-Vision se entrena principalmente en este corpus, con datos multimodales auxiliares utilizados como una mezcla que preserva capacidades, y no requiere cabezales de predicción específicos para tareas ni modificaciones arquitectónicas. El modelo resultante cubre una amplia gama de tareas de visión, incluyendo detección, OCR, estimación de puntos clave, segmentación, estimación de profundidad, predicción de normales de superficie, mapas de puntos y estimación de pose de cámara, al tiempo que admite variantes definidas por lenguaje que combinan categoría, color, región y otras señales visuales. Los experimentos muestran que un único modelo unificado puede igualar a los sistemas especializados líderes en comprensión visual estructurada, predicción geométrica densa, segmentación y geometría visual multivista. Estos resultados sugieren que la generación multimodal unificada constituye una vía escalable para integrar capacidades de visión por computadora en modelos fundacionales de uso general. El modelo y el corpus están disponibles públicamente.
English
We formulate computer vision as unified multimodal generation, where heterogeneous visual tasks are expressed in the native text and image generation spaces of a unified multimodal model, without task-specific architectures. Under this formulation, SenseNova-Vision uses natural-language instructions and optional visual prompts to specify tasks, target regions or views, and decoding conventions, and generates responses as text for symbolic outputs, images for dense spatial predictions, or mixed text-and-image outputs for compositional tasks. To support large-scale training, we convert diverse computer vision annotations into instruction-response examples compatible with these generation spaces, resulting in the SenseNova-Vision Corpus, a computer-vision instruction-response corpus spanning text, image, and mixed targets. Starting from an off-the-shelf pretrained unified multimodal model, SenseNova-Vision is trained primarily on this corpus, with auxiliary multimodal data used as a capability-preserving mixture, and requires no task-specific prediction heads or architectural modifications. The resulting model covers a broad range of vision tasks, including detection, OCR, keypoint estimation, segmentation, depth estimation, surface normal prediction, point maps, and camera pose estimation, while supporting language-defined variants that combine category, color, region, and other visual cues. Experiments show that a single unified model can match leading task-specialized systems across structured visual understanding, dense geometric prediction, segmentation, and multi-view visual geometry. These results suggest unified multimodal generation as a scalable route for integrating computer vision capabilities into general-purpose foundation models. The model and corpus are publicly available.