Пусть RGB будет языком зрения.
Let RGB Be the Language of Vision
July 14, 2026
Авторы: Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang
cs.AI
Аннотация
Данная работа представляет унифицированную формулировку для моделей компьютерного зрения, в которой различные формы визуальной информации, выходящие за рамки естественных изображений, такие как маски, карты глубины и другие структурированные визуальные сигналы, представляются в виде RGB-изображений, а общие визуальные задачи сводятся к общей проблеме редактирования изображений типа «RGB в RGB». В этой парадигме различные типы визуальной информации внутренне разделяют одну и ту же архитектуру кодирования и декодирования и параметры с естественными изображениями, что позволяет единой модели переносить знания между задачами через унифицированный визуальный интерфейс, аналогично тому, как языковые модели работают с текстом. Мы называем эту формулировку «RGB In and RGB Out» (RINO). Построенная на основе общего ядра редактирования изображений без тонкой настройки под конкретные задачи, RINO демонстрирует устойчивую и конкурентоспособную производительность с нулевым обучением как в задачах плотного понимания, таких как сегментация и оценка глубины (где мы унифицируем выходные данные как RGB), так и в задачах генерации с плотными условиями, таких как генерация изображения по позе (где мы унифицируем входные данные как RGB). Мы надеемся, что это исследование даст полезные идеи для создания общих унифицированных систем «зрение-язык», в которых различные визуальные задачи могут быть выражены, интерпретированы и решены через общий визуальный язык. Код доступен по адресу https://github.com/yangtiming/RINO.
English
This work introduces a unified formulation for vision models, where diverse forms of visual information beyond natural images, such as masks, depth maps, and other structured visual signals, are all represented as RGB images, while general visual tasks can be converted into a common RGB-to-RGB image editing problem. In this paradigm, different types of visual information internally share the same encoding and decoding architecture and parameters as natural images, enabling a single model to transfer across tasks through a unified visual interface, in a way analogous to how language models operate over text. We refer to this formulation as RGB In and RGB Out (RINO). Built upon a generic image editing backbone without task-specific fine-tuning, RINO demonstrates robust and competitive zero-shot performance on both dense understanding tasks such as segmentation and depth estimation (where we unify outputs as RGB), and dense-conditioned generation tasks such as pose-to-image generation (where we unify inputs as RGB). We hope this study provides useful insights toward general unified vision-language systems, where diverse visual tasks can be expressed, interpreted, and solved through a shared visual language. Code is available at https://github.com/yangtiming/RINO.