ChatPaper.aiChatPaper

Van RGB-generatie naar dichte velduitlezing: dichte predictie in pixelruimte met tekst-naar-beeldmodellen

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

July 9, 2026
Auteurs: Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li
cs.AI

Samenvatting

Grootschalige tekst-naar-beeld modellen zijn aantrekkelijke backbones voor dichte voorspellingen omdat RGB-generatie pre-training rijke semantische, structurele en geometrische prioriën leert. Bestaande generatieve en bewerkingsbenaderingen hergebruiken deze prioriën door dichte voorspelling als doelgeneratie te gieten: annotaties zoals diepte, normalen, alfamatten, maskers en heatmaps worden gecodeerd in een met RGB getrainde VAE-latente ruimte en teruggedecodeerd als beeldachtige doelen. Wij beargumenteren dat dit meer van de generatieve uitvoerinterface erft dan dichte voorspelling vereist: in tegenstelling tot RGB-synthese vraagt dichte voorspelling om pixel-correcte, taakgebonden velden op hetzelfde beeldvlak, niet om nieuwe RGB-inhoud die moet worden weergegeven. Onze belangrijkste observatie is dat een voorgetrainde DiT al RGB-ingangen organiseert via een patch-naar-token-naar-patch rooster op het beeldvlak, dus elke token indexeert een vaste uitvoerpatch waarvan de kanalen taakgebonden grootheden kunnen dragen in plaats van RGB-uiterlijk. We implementeren dit als ReChannel: we behouden de VAE-encoder voor de invoerverdeling van de DiT maar laten de doelzijde-decoder weg, passen de bevroren DiT aan met taak-LoRA, en koppelen elke token aan zijn p x p x K_t pixelruimte-patch via een gedeelde token-lokale lineaire kop -- ongeveer 33K parameters, geen ruimtelijke menging. Met FLUX-Klein evalueren we op zes dichte voorspellingstaken en meer dan een dozijn benchmarks. Deze minimale interface zet een nieuwe state-of-the-art op trimap-vrij matten, KITTI-diepte, en verwijzende segmentatie, en blijft concurrerend op normalen, saillantie en pose. In een gematchte 4B-setting is het nauwkeuriger en 2,48x sneller dan een edit-plus-latent-decode tegenhanger -- dichte perceptie kan profiteren van generatieve pre-training zonder de uitvoerinterface ervan over te nemen.
English
Large-scale text-to-image models are attractive backbones for dense prediction because RGB generation pretraining learns rich semantic, structural, and geometric priors. Existing generative and editing approaches reuse these priors by casting dense prediction as target generation: annotations such as depth, normals, alpha mattes, masks, and heatmaps are encoded into an RGB-trained VAE latent space and decoded back as image-like targets. We argue this inherits more of the generative output interface than dense prediction requires: unlike RGB synthesis, dense prediction asks for pixel-correct, task-native fields on the same image plane, not new RGB content to be rendered. Our key observation is that a pretrained DiT already organizes RGB inputs through a patch-to-token-to-patch lattice on the image plane, so each token indexes a fixed output patch whose channels can carry task-native quantities instead of RGB appearance. We instantiate this as ReChannel: we keep the VAE encoder for the DiT's input distribution but drop the target-side decoder, adapt the frozen DiT with task LoRA, and map each token to its p x p x K_t pixel-space patch through a shared token-local linear head--about 33K parameters, no spatial mixing. Using FLUX-Klein, we evaluate on six dense prediction tasks and over a dozen benchmarks. This minimal interface sets new state-of-the-art on trimap-free matting, KITTI depth, and referring segmentation, and stays competitive on normals, saliency, and pose. In a matched 4B setting it is more accurate and 2.48x faster than an edit-plus-latent-decode counterpart--dense perception can benefit from generative pretraining without inheriting its output interface.