Que le RVB soit le langage de la vision
Let RGB Be the Language of Vision
July 14, 2026
Auteurs: Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang
cs.AI
Résumé
Ce travail introduit une formulation unifiée pour les modèles de vision, où diverses formes d’informations visuelles au-delà des images naturelles, telles que les masques, les cartes de profondeur et autres signaux visuels structurés, sont toutes représentées sous forme d’images RVB, tandis que des tâches visuelles générales peuvent être converties en un problème commun d’édition d’images RVB vers RVB. Dans ce paradigme, différents types d’informations visuelles partagent en interne la même architecture d’encodage et de décodage ainsi que les mêmes paramètres que les images naturelles, permettant à un seul modèle de faire le transfert entre tâches via une interface visuelle unifiée, de manière analogue au fonctionnement des modèles de langage sur le texte. Nous désignons cette formulation sous le nom de RVB Entrée et RVB Sortie (RINO). Construit sur une architecture de base générique d’édition d’images sans ajustement fin spécifique à une tâche, RINO démontre des performances robustes et compétitives en zero-shot à la fois sur des tâches de compréhension dense telles que la segmentation et l’estimation de profondeur (où nous unifions les sorties en RVB), et sur des tâches de génération conditionnée dense telles que la génération d’images à partir de poses (où nous unifions les entrées en RVB). Nous espérons que cette étude apportera des perspectives utiles vers des systèmes vision-langage unifiés généraux, où diverses tâches visuelles peuvent être exprimées, interprétées et résolues à travers un langage visuel partagé. Le code est disponible à l’adresse https://github.com/yangtiming/RINO.
English
This work introduces a unified formulation for vision models, where diverse forms of visual information beyond natural images, such as masks, depth maps, and other structured visual signals, are all represented as RGB images, while general visual tasks can be converted into a common RGB-to-RGB image editing problem. In this paradigm, different types of visual information internally share the same encoding and decoding architecture and parameters as natural images, enabling a single model to transfer across tasks through a unified visual interface, in a way analogous to how language models operate over text. We refer to this formulation as RGB In and RGB Out (RINO). Built upon a generic image editing backbone without task-specific fine-tuning, RINO demonstrates robust and competitive zero-shot performance on both dense understanding tasks such as segmentation and depth estimation (where we unify outputs as RGB), and dense-conditioned generation tasks such as pose-to-image generation (where we unify inputs as RGB). We hope this study provides useful insights toward general unified vision-language systems, where diverse visual tasks can be expressed, interpreted, and solved through a shared visual language. Code is available at https://github.com/yangtiming/RINO.