De la génération RVB à la lecture de champ dense : Prédiction dense dans l'espace pixel avec des modèles texte-image
From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models
July 9, 2026
Auteurs: Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li
cs.AI
Résumé
Les modèles texte-à-image à grande échelle constituent des architectures de base attrayantes pour la prédiction dense, car le pré-entraînement sur la génération RVB apprend des a priori sémantiques, structurels et géométriques riches. Les approches génératives et d'édition existantes réutilisent ces a priori en transformant la prédiction dense en génération de cibles : des annotations telles que la profondeur, les normales, les masques alpha, les masques de segmentation et les cartes de chaleur sont encodées dans un espace latent VAE entraîné sur RVB, puis décodées en cibles de type image. Nous soutenons que cela hérite davantage de l'interface de sortie générative que ne l'exige la prédiction dense : contrairement à la synthèse RVB, la prédiction dense demande des champs natifs de la tâche, corrects au niveau du pixel, sur le même plan image, et non un nouveau contenu RVB à rendre. Notre observation clé est qu'un DiT pré-entraîné organise déjà les entrées RVB à travers un treillis patch-à-token-à-patch sur le plan image, de sorte que chaque token indexe un patch de sortie fixe dont les canaux peuvent porter des grandeurs natives de la tâche au lieu de l'apparence RVB. Nous concrétisons cela sous le nom de ReChannel : nous conservons l'encodeur VAE pour la distribution d'entrée du DiT mais supprimons le décodeur côté cible, adaptons le DiT gelé avec une LoRA de tâche, et mappons chaque token sur son patch d'espace pixel de taille p x p x K_t via une tête linéaire partagée locale au token — environ 33 000 paramètres, sans mixage spatial. En utilisant FLUX-Klein, nous évaluons sur six tâches de prédiction dense et plus d'une douzaine de benchmarks. Cette interface minimale établit un nouvel état de l'art sur le matting sans trimap, la profondeur KITTI et la segmentation référencée, et reste compétitive sur les normales, la saillance et la pose. Dans un cadre 4B apparié, elle est plus précise et 2,48 fois plus rapide qu'une contrepartie édition plus décodage latent — la perception dense peut bénéficier d'un pré-entraînement génératif sans hériter de son interface de sortie.
English
Large-scale text-to-image models are attractive backbones for dense prediction because RGB generation pretraining learns rich semantic, structural, and geometric priors. Existing generative and editing approaches reuse these priors by casting dense prediction as target generation: annotations such as depth, normals, alpha mattes, masks, and heatmaps are encoded into an RGB-trained VAE latent space and decoded back as image-like targets. We argue this inherits more of the generative output interface than dense prediction requires: unlike RGB synthesis, dense prediction asks for pixel-correct, task-native fields on the same image plane, not new RGB content to be rendered. Our key observation is that a pretrained DiT already organizes RGB inputs through a patch-to-token-to-patch lattice on the image plane, so each token indexes a fixed output patch whose channels can carry task-native quantities instead of RGB appearance. We instantiate this as ReChannel: we keep the VAE encoder for the DiT's input distribution but drop the target-side decoder, adapt the frozen DiT with task LoRA, and map each token to its p x p x K_t pixel-space patch through a shared token-local linear head--about 33K parameters, no spatial mixing. Using FLUX-Klein, we evaluate on six dense prediction tasks and over a dozen benchmarks. This minimal interface sets new state-of-the-art on trimap-free matting, KITTI depth, and referring segmentation, and stays competitive on normals, saliency, and pose. In a matched 4B setting it is more accurate and 2.48x faster than an edit-plus-latent-decode counterpart--dense perception can benefit from generative pretraining without inheriting its output interface.