ChatPaper.aiChatPaper

От генерации RGB-изображений к считыванию плотного поля: плотное предсказание в пространстве пикселей с помощью моделей текст-в-изображение

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

July 9, 2026
Авторы: Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li
cs.AI

Аннотация

Крупномасштабные модели типа «текст-в-изображение» являются привлекательными основами для плотного предсказания, поскольку предварительное обучение на генерации RGB обогащает семантическими, структурными и геометрическими априорными знаниями. Существующие генеративные и редакторские подходы повторно используют эти априорные знания, сводя плотное предсказание к генерации целевых данных: аннотации, такие как глубина, нормали, альфа-каналы, маски и тепловые карты, кодируются в латентное пространство VAE, обученное на RGB, и обратно декодируются как изображения-цели. Мы утверждаем, что такой подход наследует больше от интерфейса вывода генеративных моделей, чем требуется для плотного предсказания: в отличие от синтеза RGB, плотное предсказание требует пиксельно-корректных, соответствующих задаче полей данных на той же плоскости изображения, а не создания нового RGB-контента для рендеринга. Наше ключевое наблюдение состоит в том, что предварительно обученный DiT уже организует RGB-входы через решетку «патч→токен→патч» на плоскости изображения, так что каждый токен индексирует фиксированный выходной патч, каналы которого могут нести величины, соответствующие задаче, а не RGB-внешность. Мы реализуем это как ReChannel: сохраняем VAE-энкодер для входного распределения DiT, но отказываемся от декодера целевых данных, адаптируем замороженный DiT с помощью task LoRA и отображаем каждый токен в его пиксельное пространство размером p x p x K_t через общую токен-локальную линейную голову — около 33К параметров, без пространственного микширования. Используя FLUX-Klein, мы оцениваем модель на шести задачах плотного предсказания и более чем дюжине бенчмарков. Этот минимальный интерфейс устанавливает новый уровень передовых результатов в задачах извлечения матов без тримапа, глубины KITTI и реферирующей сегментации, а также сохраняет конкурентоспособность на нормалях, салиентности и позах. В сопоставимой конфигурации с 4B параметров он точнее и в 2,48 раза быстрее аналога, использующего редактирование и латентное декодирование: плотное восприятие может извлекать пользу из генеративного предобучения, не наследуя его выходной интерфейс.
English
Large-scale text-to-image models are attractive backbones for dense prediction because RGB generation pretraining learns rich semantic, structural, and geometric priors. Existing generative and editing approaches reuse these priors by casting dense prediction as target generation: annotations such as depth, normals, alpha mattes, masks, and heatmaps are encoded into an RGB-trained VAE latent space and decoded back as image-like targets. We argue this inherits more of the generative output interface than dense prediction requires: unlike RGB synthesis, dense prediction asks for pixel-correct, task-native fields on the same image plane, not new RGB content to be rendered. Our key observation is that a pretrained DiT already organizes RGB inputs through a patch-to-token-to-patch lattice on the image plane, so each token indexes a fixed output patch whose channels can carry task-native quantities instead of RGB appearance. We instantiate this as ReChannel: we keep the VAE encoder for the DiT's input distribution but drop the target-side decoder, adapt the frozen DiT with task LoRA, and map each token to its p x p x K_t pixel-space patch through a shared token-local linear head--about 33K parameters, no spatial mixing. Using FLUX-Klein, we evaluate on six dense prediction tasks and over a dozen benchmarks. This minimal interface sets new state-of-the-art on trimap-free matting, KITTI depth, and referring segmentation, and stays competitive on normals, saliency, and pose. In a matched 4B setting it is more accurate and 2.48x faster than an edit-plus-latent-decode counterpart--dense perception can benefit from generative pretraining without inheriting its output interface.