ChatPaper.aiChatPaper

De la Generación RGB a la Lectura de Campo Denso: Predicción Densa en el Espacio de Píxeles con Modelos de Texto a Imagen

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

July 9, 2026
Autores: Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li
cs.AI

Resumen

Los modelos de texto a imagen a gran escala son backbones atractivos para la predicción densa porque el preentrenamiento en generación RGB aprende ricos priors semánticos, estructurales y geométricos. Los enfoques generativos y de edición existentes reutilizan estos priors planteando la predicción densa como generación de objetivos: anotaciones como profundidad, normales, mates alfa, máscaras y mapas de calor se codifican en un espacio latente VAE entrenado en RGB y se decodifican nuevamente como objetivos similares a imágenes. Argumentamos que esto hereda más de la interfaz de salida generativa de lo que requiere la predicción densa: a diferencia de la síntesis RGB, la predicción densa requiere campos nativos de la tarea y correctos a nivel de píxel en el mismo plano de imagen, no nuevo contenido RGB que deba renderizarse. Nuestra observación clave es que un DiT preentrenado ya organiza las entradas RGB a través de un entramado parche-a-token-a-parche en el plano de la imagen, por lo que cada token indexa un parche de salida fijo cuyos canales pueden transportar cantidades nativas de la tarea en lugar de apariencia RGB. Implementamos esto como ReChannel: mantenemos el codificador VAE para la distribución de entrada del DiT pero eliminamos el decodificador del lado del objetivo, adaptamos el DiT congelado con LoRA de tarea, y mapeamos cada token a su parche de espacio de píxeles p × p × K_t a través de una cabeza lineal compartida local al token—aproximadamente 33 K parámetros, sin mezcla espacial. Usando FLUX-Klein, evaluamos en seis tareas de predicción densa y más de una docena de benchmarks. Esta interfaz mínima establece un nuevo estado del arte en matting sin trimap, profundidad KITTI y segmentación por referencia, y se mantiene competitiva en normales, saliencia y pose. En una configuración 4B equivalente, es más precisa y 2.48 veces más rápida que una contraparte de edición más decodificación latente—la percepción densa puede beneficiarse del preentrenamiento generativo sin heredar su interfaz de salida.
English
Large-scale text-to-image models are attractive backbones for dense prediction because RGB generation pretraining learns rich semantic, structural, and geometric priors. Existing generative and editing approaches reuse these priors by casting dense prediction as target generation: annotations such as depth, normals, alpha mattes, masks, and heatmaps are encoded into an RGB-trained VAE latent space and decoded back as image-like targets. We argue this inherits more of the generative output interface than dense prediction requires: unlike RGB synthesis, dense prediction asks for pixel-correct, task-native fields on the same image plane, not new RGB content to be rendered. Our key observation is that a pretrained DiT already organizes RGB inputs through a patch-to-token-to-patch lattice on the image plane, so each token indexes a fixed output patch whose channels can carry task-native quantities instead of RGB appearance. We instantiate this as ReChannel: we keep the VAE encoder for the DiT's input distribution but drop the target-side decoder, adapt the frozen DiT with task LoRA, and map each token to its p x p x K_t pixel-space patch through a shared token-local linear head--about 33K parameters, no spatial mixing. Using FLUX-Klein, we evaluate on six dense prediction tasks and over a dozen benchmarks. This minimal interface sets new state-of-the-art on trimap-free matting, KITTI depth, and referring segmentation, and stays competitive on normals, saliency, and pose. In a matched 4B setting it is more accurate and 2.48x faster than an edit-plus-latent-decode counterpart--dense perception can benefit from generative pretraining without inheriting its output interface.