Laat RGB de taal van het zien zijn.
Let RGB Be the Language of Vision
July 14, 2026
Auteurs: Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang
cs.AI
Samenvatting
Dit werk introduceert een uniforme formulering voor visiemodellen, waarbij diverse vormen van visuele informatie buiten natuurlijke afbeeldingen, zoals maskers, dieptekaarten en andere gestructureerde visuele signalen, allemaal worden weergegeven als RGB-afbeeldingen, terwijl algemene visuele taken kunnen worden omgezet in een gemeenschappelijk RGB-naar-RGB-beeldbewerkingsprobleem. In dit paradigma delen verschillende soorten visuele informatie intern dezelfde coderings- en decoderingsarchitectuur en parameters als natuurlijke afbeeldingen, waardoor één enkel model taken kan overdragen via een uniforme visuele interface, op een manier die analoog is aan hoe taalmodellen over tekst werken. We verwijzen naar deze formulering als RGB In en RGB Out (RINO). RINO, gebouwd op een generiek beeldbewerkingsraamwerk zonder taakspecifieke fijnafstemming, vertoont robuuste en concurrerende zero-shot-prestaties op zowel dichte begripstaken zoals segmentatie en diepteschatting (waar we uitgangen als RGB uniformeren) als dicht-geconditioneerde generatietaken zoals pose-naar-beeldgeneratie (waar we ingangen als RGB uniformeren). We hopen dat deze studie nuttige inzichten biedt voor algemene uniforme visie-taal-systemen, waarin diverse visuele taken kunnen worden uitgedrukt, geïnterpreteerd en opgelost via een gedeelde visuele taal. Code is beschikbaar op https://github.com/yangtiming/RINO.
English
This work introduces a unified formulation for vision models, where diverse forms of visual information beyond natural images, such as masks, depth maps, and other structured visual signals, are all represented as RGB images, while general visual tasks can be converted into a common RGB-to-RGB image editing problem. In this paradigm, different types of visual information internally share the same encoding and decoding architecture and parameters as natural images, enabling a single model to transfer across tasks through a unified visual interface, in a way analogous to how language models operate over text. We refer to this formulation as RGB In and RGB Out (RINO). Built upon a generic image editing backbone without task-specific fine-tuning, RINO demonstrates robust and competitive zero-shot performance on both dense understanding tasks such as segmentation and depth estimation (where we unify outputs as RGB), and dense-conditioned generation tasks such as pose-to-image generation (where we unify inputs as RGB). We hope this study provides useful insights toward general unified vision-language systems, where diverse visual tasks can be expressed, interpreted, and solved through a shared visual language. Code is available at https://github.com/yangtiming/RINO.