ChatPaper.aiChatPaper

Sei RGB die Sprache des Sehens.

Let RGB Be the Language of Vision

July 14, 2026
Autoren: Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang
cs.AI

Zusammenfassung

Diese Arbeit führt eine einheitliche Formulierung für Vision-Modelle ein, bei der verschiedene Formen visueller Informationen jenseits natürlicher Bilder – wie Masken, Tiefenkarten und andere strukturierte visuelle Signale – sämtlich als RGB-Bilder dargestellt werden, während allgemeine visuelle Aufgaben in ein gemeinsames RGB-zu-RGB-Bildbearbeitungsproblem überführt werden können. In diesem Paradigma teilen verschiedene Arten visueller Informationen intern dieselbe Kodierungs- und Dekodierungsarchitektur sowie dieselben Parameter wie natürliche Bilder, sodass ein einzelnes Modell durch eine einheitliche visuelle Schnittstelle Aufgaben übergreifend übertragen kann – analog zur Funktionsweise von Sprachmodellen über Text hinweg. Wir bezeichnen diese Formulierung als RGB In and RGB Out (RINO). Aufbauend auf einem generischen Bildbearbeitungs-Backbone ohne aufgabenspezifische Feinabstimmung zeigt RINO robuste und wettbewerbsfähige Zero-Shot-Leistungen sowohl bei dichten Verständnisaufgaben wie Segmentierung und Tiefenschätzung (bei denen wir Ausgaben als RGB vereinheitlichen) als auch bei dicht konditionierten Generierungsaufgaben wie der Pose-zu-Bild-Generierung (bei denen wir Eingaben als RGB vereinheitlichen). Wir hoffen, dass diese Studie nützliche Erkenntnisse für allgemeine einheitliche Vision-Language-Systeme liefert, in denen verschiedene visuelle Aufgaben durch eine gemeinsame visuelle Sprache ausgedrückt, interpretiert und gelöst werden können. Code ist verfügbar unter https://github.com/yangtiming/RINO.
English
This work introduces a unified formulation for vision models, where diverse forms of visual information beyond natural images, such as masks, depth maps, and other structured visual signals, are all represented as RGB images, while general visual tasks can be converted into a common RGB-to-RGB image editing problem. In this paradigm, different types of visual information internally share the same encoding and decoding architecture and parameters as natural images, enabling a single model to transfer across tasks through a unified visual interface, in a way analogous to how language models operate over text. We refer to this formulation as RGB In and RGB Out (RINO). Built upon a generic image editing backbone without task-specific fine-tuning, RINO demonstrates robust and competitive zero-shot performance on both dense understanding tasks such as segmentation and depth estimation (where we unify outputs as RGB), and dense-conditioned generation tasks such as pose-to-image generation (where we unify inputs as RGB). We hope this study provides useful insights toward general unified vision-language systems, where diverse visual tasks can be expressed, interpreted, and solved through a shared visual language. Code is available at https://github.com/yangtiming/RINO.