ChatPaper.aiChatPaper

Além da Última Camada: Fusão de Representações Multicamadas para Tokenização Visual

Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

May 12, 2026
Autores: Xuanyu Zhu, Yan Bai, Yang Shi, Yihang Lou, Yuanxing Zhang, Jing Jin, Yuan Zhou
cs.AI

Resumo

Autoencoders de representação que reutilizam codificadores visuais pré-treinados congelados como tokenizadores visuais alcançaram forte qualidade de reconstrução e geração. No entanto, métodos existentes extraem universalmente características apenas da última camada do codificador, descartando a rica informação hierárquica distribuída entre camadas intermediárias. Mostramos que detalhes visuais de baixo nível sobrevivem na última camada meramente como resíduos atenuados após múltiplas camadas de abstração semântica, e que a fusão explícita de características de múltiplas camadas pode recuperar substancialmente essa informação perdida. Propomos o DRoRAE (Representation AutoEncoder com Roteamento de Profundidade), um módulo de fusão leve que agrega adaptativamente todas as camadas do codificador por meio de roteamento com restrição de energia e correção incremental, produzindo um latente enriquecido compatível com um decodificador pré-treinado congelado. Uma estratégia de treinamento dissociado em três fases primeiro aprende a fusão sob a restrição distribucional implícita do decodificador congelado, então ajusta finamente o decodificador para explorar plenamente a representação enriquecida. No ImageNet-256, o DRoRAE reduz o rFID de 0,57 para 0,29 e melhora o FID de geração de 1,74 para 1,65 (com AutoGuidance), com ganhos também transferíveis para síntese texto-imagem. Além disso, descobrimos uma lei de escala log-linear (R²=0,86) entre capacidade de fusão e qualidade de reconstrução, identificando a riqueza de representação como uma nova dimensão previsivelmente escalável para tokenizadores visuais, análoga ao tamanho do vocabulário em PNL.
English
Representation autoencoders that reuse frozen pretrained vision encoders as visual tokenizers have achieved strong reconstruction and generation quality. However, existing methods universally extract features from only the last encoder layer, discarding the rich hierarchical information distributed across intermediate layers. We show that low-level visual details survive in the last layer merely as attenuated residuals after multiple layers of semantic abstraction, and that explicitly fusing multi-layer features can substantially recover this lost information. We propose DRoRAE (Depth-Routed Representation AutoEncoder), a lightweight fusion module that adaptively aggregates all encoder layers via energy-constrained routing and incremental correction, producing an enriched latent compatible with a frozen pretrained decoder. A three-phase decoupled training strategy first learns the fusion under the implicit distributional constraint of the frozen decoder, then fine-tunes the decoder to fully exploit the enriched representation. On ImageNet-256, DRoRAE reduces rFID from 0.57 to 0.29 and improves generation FID from 1.74 to 1.65 (with AutoGuidance), with gains also transferring to text-to-image synthesis. Furthermore, we uncover a log-linear scaling law (R^2{=}0.86) between fusion capacity and reconstruction quality, identifying representation richness as a new, predictably scalable dimension for visual tokenizers analogous to vocabulary size in NLP.