ChatPaper.aiChatPaper

Que o RGB Seja a Linguagem da Visão

Let RGB Be the Language of Vision

July 14, 2026
Autores: Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang
cs.AI

Resumo

Este trabalho apresenta uma formulação unificada para modelos de visão, na qual diversas formas de informação visual além de imagens naturais, como máscaras, mapas de profundidade e outros sinais visuais estruturados, são todas representadas como imagens RGB, enquanto tarefas visuais gerais podem ser convertidas em um problema comum de edição de imagem RGB-para-RGB. Nesse paradigma, diferentes tipos de informação visual compartilham internamente a mesma arquitetura de codificação e decodificação e os mesmos parâmetros que as imagens naturais, permitindo que um único modelo realize transferência entre tarefas por meio de uma interface visual unificada, de forma análoga ao modo como modelos de linguagem operam sobre texto. Denominamos essa formulação de RGB In e RGB Out (RINO). Construído sobre um backbone genérico de edição de imagens, sem ajuste fino específico para tarefas, o RINO demonstra desempenho zero-shot robusto e competitivo tanto em tarefas densas de compreensão, como segmentação e estimativa de profundidade (nas quais unificamos as saídas como RGB), quanto em tarefas de geração condicionada densa, como geração de pose para imagem (nas quais unificamos as entradas como RGB). Esperamos que este estudo forneça insights úteis para sistemas unificados gerais de visão-linguagem, nos quais diversas tarefas visuais possam ser expressas, interpretadas e resolvidas por meio de uma linguagem visual compartilhada. O código está disponível em https://github.com/yangtiming/RINO.
English
This work introduces a unified formulation for vision models, where diverse forms of visual information beyond natural images, such as masks, depth maps, and other structured visual signals, are all represented as RGB images, while general visual tasks can be converted into a common RGB-to-RGB image editing problem. In this paradigm, different types of visual information internally share the same encoding and decoding architecture and parameters as natural images, enabling a single model to transfer across tasks through a unified visual interface, in a way analogous to how language models operate over text. We refer to this formulation as RGB In and RGB Out (RINO). Built upon a generic image editing backbone without task-specific fine-tuning, RINO demonstrates robust and competitive zero-shot performance on both dense understanding tasks such as segmentation and depth estimation (where we unify outputs as RGB), and dense-conditioned generation tasks such as pose-to-image generation (where we unify inputs as RGB). We hope this study provides useful insights toward general unified vision-language systems, where diverse visual tasks can be expressed, interpreted, and solved through a shared visual language. Code is available at https://github.com/yangtiming/RINO.