Зрение как единая мультимодальная генерация
Vision as Unified Multimodal Generation
July 7, 2026
Авторы: Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang
cs.AI
Аннотация
Мы формулируем компьютерное зрение как унифицированную мультимодальную генерацию, где разнородные визуальные задачи выражаются в пространствах генерации текста и изображений единой мультимодальной модели без использования специализированных архитектур для конкретных задач. В рамках этой формулировки SenseNova-Vision использует инструкции на естественном языке и опциональные визуальные подсказки для определения задач, целевых областей или видов, а также соглашений о декодировании, и генерирует ответы в виде текста для символьных выходов, изображений для плотных пространственных предсказаний или смешанных текстово-изображенческих выходов для композиционных задач. Для поддержки крупномасштабного обучения мы преобразуем разнообразные аннотации компьютерного зрения в примеры формата «инструкция-ответ», совместимые с этими пространствами генерации, что приводит к созданию SenseNova-Vision Corpus — корпуса инструкций-ответов по компьютерному зрению, охватывающего текстовые, изображенческие и смешанные целевые выходы. Начиная с готовой предварительно обученной унифицированной мультимодальной модели, SenseNova-Vision обучается в основном на этом корпусе с использованием вспомогательных мультимодальных данных как смеси, сохраняющей способности; при этом не требуются прогностические головки или архитектурные модификации для конкретных задач. Полученная модель охватывает широкий спектр задач компьютерного зрения, включая детекцию, OCR, оценку ключевых точек, сегментацию, оценку глубины, предсказание нормалей поверхности, карты точек и оценку позы камеры, а также поддерживает варианты, определяемые языком, которые комбинируют категорию, цвет, область и другие визуальные подсказки. Эксперименты показывают, что единая модель может соответствовать ведущим специализированным системам в задачах структурированного визуального понимания, плотного геометрического предсказания, сегментации и многовидовой визуальной геометрии. Эти результаты указывают на то, что унифицированная мультимодальная генерация является масштабируемым путём для интеграции возможностей компьютерного зрения в фундаментальные модели общего назначения. Модель и корпус доступны публично.
English
We formulate computer vision as unified multimodal generation, where heterogeneous visual tasks are expressed in the native text and image generation spaces of a unified multimodal model, without task-specific architectures. Under this formulation, SenseNova-Vision uses natural-language instructions and optional visual prompts to specify tasks, target regions or views, and decoding conventions, and generates responses as text for symbolic outputs, images for dense spatial predictions, or mixed text-and-image outputs for compositional tasks. To support large-scale training, we convert diverse computer vision annotations into instruction-response examples compatible with these generation spaces, resulting in the SenseNova-Vision Corpus, a computer-vision instruction-response corpus spanning text, image, and mixed targets. Starting from an off-the-shelf pretrained unified multimodal model, SenseNova-Vision is trained primarily on this corpus, with auxiliary multimodal data used as a capability-preserving mixture, and requires no task-specific prediction heads or architectural modifications. The resulting model covers a broad range of vision tasks, including detection, OCR, keypoint estimation, segmentation, depth estimation, surface normal prediction, point maps, and camera pose estimation, while supporting language-defined variants that combine category, color, region, and other visual cues. Experiments show that a single unified model can match leading task-specialized systems across structured visual understanding, dense geometric prediction, segmentation, and multi-view visual geometry. These results suggest unified multimodal generation as a scalable route for integrating computer vision capabilities into general-purpose foundation models. The model and corpus are publicly available.