GEAR: Geleide End-to-End Autoregressie voor Beeldsynthese
GEAR: Guided End-to-End AutoRegression for Image Synthesis
June 30, 2026
Auteurs: Bin Lin, Zheyuan Liu, Chenguo Lin, Sixiang Chen, Yunyang Ge, Yunlong Lin, Jianwei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Li Yuan
cs.AI
Samenvatting
Visuele generatieve modellen worden doorgaans in twee fasen getraind. Eerst wordt een tokenizer getraind voor reconstructie en vervolgens bevroren, waarna een generator wordt getraind op zijn discrete indices of continue latenten. Deze ontkoppeling zorgt ervoor dat de tokenizer niet weet wat de generator gemakkelijk kan modelleren. We presenteren GEAR (Guided End-to-end AutoRegression), die een vector-gekwantiseerde (VQ) tokenizer en een autoregressieve (AR) generator gezamenlijk en end-to-end traint, geleid door representatie-afstemming. Het belangrijkste obstakel is dat de VQ-index die aan het AR-model wordt gevoerd niet-differentieerbaar is, waardoor gradiënten de tokenizer niet kunnen bereiken en een straight-through estimator instort. GEAR lost dit op met een dubbele uitlezing van de codeboektoewijzing. Een harde, one-hot tak traint de AR met next-token predictie, terwijl een differentieerbare zachte tak een representatie-afstemmingsverlies draagt dat terugvloeit om alleen de tokenizer te sturen. Het AR-model stuurt daarmee zijn tokenizer richting een indexverdeling die het gemakkelijker kan voorspellen. Dit verschuift de afstemmingslast van de tokenizer naar de AR: de eigen kenmerken van de tokenizer worden minder DINOv2-achtig, terwijl die van de AR meer DINOv2-achtig worden, het tegenovergestelde van diffusiezijdige recepten die de latent zelf semantisch maken. GEAR versnelt de ImageNet gFID-convergentie met tot 10x ten opzichte van de sterke LlamaGen-REPA-baseline, leert aanzienlijk betere patch-niveau en ruimtelijk coherente kenmerken, en generaliseert over kwantisatoren (VQVAE, LFQ, IBQ) en naar tekst-naar-beeld generatie.
English
Visual generative models are typically trained in two stages. A tokenizer is first trained for reconstruction and then frozen, after which a generator is trained on its discrete indices or continuous latents. This decoupling leaves the tokenizer unaware of what the generator finds easy to model. We present GEAR (Guided End-to-end AutoRegression), which trains a vector-quantized (VQ) tokenizer and an autoregressive (AR) generator jointly and end-to-end, guided by representation alignment. The key obstacle is that the VQ index fed to the AR model is non-differentiable, so gradients cannot reach the tokenizer, and a straight-through estimator collapses. GEAR resolves this with a dual read-out of the codebook assignment. A hard, one-hot branch trains the AR with next-token prediction, while a differentiable soft branch carries a representation-alignment loss that flows back to guide only the tokenizer. The AR model thereby steers its tokenizer toward an index distribution it can predict more easily. This shifts the alignment burden from the tokenizer to the AR: the tokenizer's own features become less DINOv2-like while the AR's become more so, the opposite of diffusion-side recipes that make the latent itself semantic. GEAR speeds up ImageNet gFID convergence by up to 10x relative to the strong LlamaGen-REPA baseline, learns markedly better patch-level and spatially-coherent features, and generalizes across quantizers (VQVAE, LFQ, IBQ) and to text-to-image generation.