ChatPaper.aiChatPaper

Sea RGB el lenguaje de la visión.

Let RGB Be the Language of Vision

July 14, 2026
Autores: Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang
cs.AI

Resumen

Este trabajo introduce una formulación unificada para modelos de visión, donde diversas formas de información visual más allá de las imágenes naturales, como máscaras, mapas de profundidad y otras señales visuales estructuradas, se representan todas como imágenes RGB, mientras que las tareas visuales generales pueden convertirse en un problema común de edición de imágenes de RGB a RGB. En este paradigma, los diferentes tipos de información visual comparten internamente la misma arquitectura y los mismos parámetros de codificación y decodificación que las imágenes naturales, lo que permite que un solo modelo transfiera habilidades entre tareas a través de una interfaz visual unificada, de manera análoga a como los modelos de lenguaje operan sobre texto. Nos referimos a esta formulación como RGB In y RGB Out (RINO). Basado en una arquitectura genérica de edición de imágenes sin ajuste fino específico de tarea, RINO demuestra un rendimiento robusto y competitivo en modo zero-shot tanto en tareas de comprensión densa, como segmentación y estimación de profundidad (donde unificamos las salidas como RGB), como en tareas de generación condicionadas densamente, como la generación de pose a imagen (donde unificamos las entradas como RGB). Esperamos que este estudio proporcione perspectivas útiles hacia sistemas unificados de visión y lenguaje, donde diversas tareas visuales puedan expresarse, interpretarse y resolverse mediante un lenguaje visual compartido. El código está disponible en https://github.com/yangtiming/RINO.
English
This work introduces a unified formulation for vision models, where diverse forms of visual information beyond natural images, such as masks, depth maps, and other structured visual signals, are all represented as RGB images, while general visual tasks can be converted into a common RGB-to-RGB image editing problem. In this paradigm, different types of visual information internally share the same encoding and decoding architecture and parameters as natural images, enabling a single model to transfer across tasks through a unified visual interface, in a way analogous to how language models operate over text. We refer to this formulation as RGB In and RGB Out (RINO). Built upon a generic image editing backbone without task-specific fine-tuning, RINO demonstrates robust and competitive zero-shot performance on both dense understanding tasks such as segmentation and depth estimation (where we unify outputs as RGB), and dense-conditioned generation tasks such as pose-to-image generation (where we unify inputs as RGB). We hope this study provides useful insights toward general unified vision-language systems, where diverse visual tasks can be expressed, interpreted, and solved through a shared visual language. Code is available at https://github.com/yangtiming/RINO.