ChatPaper.aiChatPaper

Voorbij de laatste laag: Meerlagige representatiefusie voor visuele tokenisatie

Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

May 12, 2026
Auteurs: Xuanyu Zhu, Yan Bai, Yang Shi, Yihang Lou, Yuanxing Zhang, Jing Jin, Yuan Zhou
cs.AI

Samenvatting

Representatie-auto-encoders die ingevroren voorgetrainde visie-encoders hergebruiken als visuele tokenizers hebben een sterke reconstructie- en generatiekwaliteit behaald. Bestaande methoden extraheren echter universeel kenmerken uit alleen de laatste encodergelaag, waarbij de rijke hiërarchische informatie over de tussenliggende lagen wordt genegeerd. Wij tonen aan dat laag-niveau visuele details in de laatste laag slechts als verzwakte residuen overleven na meerdere lagen van semantische abstractie, en dat het expliciet fuseren van meerlaagse kenmerken deze verloren informatie aanzienlijk kan herstellen. We stellen DRoRAE (Depth-Routed Representation AutoEncoder) voor, een lichtgewicht fusiemodule die adaptief alle encodergelagen aggregeert via energiebegrensde routering en incrementele correctie, wat een verrijkte latente representatie oplevert die compatibel is met een ingevroren voorgetrainde decoder. Een driefasige ontkoppelde trainingsstrategie leert eerst de fusie onder de impliciete distributiebeperking van de ingevroren decoder, en verfijnt vervolgens de decoder om de verrijkte representatie volledig te benutten. Op ImageNet-256 verlaagt DRoRAE rFID van 0,57 naar 0,29 en verbetert het de generatie-FID van 1,74 naar 1,65 (met AutoGuidance), waarbij de winst ook overgaat naar tekst-naar-beeld-synthese. Verder ontdekken we een log-lineaire schalingswet (R²=0,86) tussen fusiecapaciteit en reconstructiekwaliteit, waarmee representatierijkheid wordt geïdentificeerd als een nieuwe, voorspelbaar schaalbare dimensie voor visuele tokenizers, analoog aan de vocabulairegrootte in NLP.
English
Representation autoencoders that reuse frozen pretrained vision encoders as visual tokenizers have achieved strong reconstruction and generation quality. However, existing methods universally extract features from only the last encoder layer, discarding the rich hierarchical information distributed across intermediate layers. We show that low-level visual details survive in the last layer merely as attenuated residuals after multiple layers of semantic abstraction, and that explicitly fusing multi-layer features can substantially recover this lost information. We propose DRoRAE (Depth-Routed Representation AutoEncoder), a lightweight fusion module that adaptively aggregates all encoder layers via energy-constrained routing and incremental correction, producing an enriched latent compatible with a frozen pretrained decoder. A three-phase decoupled training strategy first learns the fusion under the implicit distributional constraint of the frozen decoder, then fine-tunes the decoder to fully exploit the enriched representation. On ImageNet-256, DRoRAE reduces rFID from 0.57 to 0.29 and improves generation FID from 1.74 to 1.65 (with AutoGuidance), with gains also transferring to text-to-image synthesis. Furthermore, we uncover a log-linear scaling law (R^2{=}0.86) between fusion capacity and reconstruction quality, identifying representation richness as a new, predictably scalable dimension for visual tokenizers analogous to vocabulary size in NLP.