Parallelle Rollout-benadering voor Autoregressieve Beeldgeneratie in de Pixelruimte
Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation
June 26, 2026
Auteurs: Jiayi Xu, Di He, Guolin Ke
cs.AI
Samenvatting
Pixelruimte continue-token autoregressieve (AR) generatie modelleert afbeeldingen direct als reeksen van ruwe pixelpatches, waarbij discrete tokenisatie of een apart voorgetrainde tokenizer wordt vermeden. Het staat echter voor gekoppelde uitdagingen: hoogdimensionale patchgeneratie veroorzaakt grote enkelstapsfouten, en docent-gedwongen training creëert een train-inferentiekloof die ervoor zorgt dat deze fouten zich ophopen over AR-stappen heen. Bestaande oplossingen zoals x-voorspelling en ruisinjectie op de invoer verminderen deze problemen slechts gedeeltelijk. Exacte rollout-training komt beter overeen met de omstandigheden tijdens inferentie, maar is onpraktisch vanwege de prohibitief trage sequentiële bemonstering. We stellen Parallelle Rollout Benadering (PRA) voor, een schaalbaar raamwerk dat beide uitdagingen gezamenlijk aanpakt. PRA genereert laagdimensionale tussentoestanden in plaats van hoogdimensionale pixelpatches, en kaart ze vervolgens terug naar pixelruimte-tokens met een pixeldecoder, waarbij een pixel-in, pixel-out AR-interface behouden blijft. Het construeert ook inferentie-achtige pixelinvoeren via hetzelfde tussentoestand-naar-pixel pad dat bij inferentie wordt gebruikt, onafhankelijk over posities heen, waarbij de pixel-feedback interface wordt benaderd die tijdens rollout tijdens inferentie wordt tegengekomen, terwijl parallelle docent-gedwongen training behouden blijft. Bij klasse-conditional ImageNet-1K generatie op 256×256 resolutie behaalt PRA-S met 135M parameters een FID van 2,58, waarmee het eerdere pixelruimte AR-resultaat op miljardenschaal van 3,60 wordt overtroffen. Opschaling naar PRA-L met 511M parameters verbetert de FID verder tot 1,94, waarmee een nieuwe state-of-the-art onder pixelruimte AR-modellen wordt gevestigd. Naast generatie behaalt PRA een hogere ImageNet-classificatie probing-nauwkeurigheid dan andere AR- en diffusie-baselines, wat wijst op zijn potentieel voor uniforme pixelruimte beeldgeneratie en -begrip.
English
Pixel-space continuous-token autoregressive (AR) generation directly models images as sequences of raw pixel patches, avoiding discrete tokenization or a separately pretrained tokenizer. However, it faces coupled challenges: high-dimensional patch generation causes large single-step errors, and teacher-forced training creates a train--inference gap that makes these errors accumulate across AR steps. Existing fixes such as x-prediction and input noise injection only partially mitigate these issues. Exact rollout training better matches inference-time conditions, but is impractical due to prohibitively slow sequential sampling. We propose Parallel Rollout Approximation (PRA), a scalable framework that addresses both challenges jointly. PRA generates low-dimensional intermediate states instead of high-dimensional pixel patches, then maps them back to pixel-space tokens with a pixel decoder, preserving a pixel-in, pixel-out AR interface. It also constructs inference-like pixel inputs through the same intermediate-state-to-pixel path used at inference, independently across positions, approximating the pixel-feedback interface encountered during inference-time rollout while retaining parallel teacher-forced training. On class-conditional ImageNet-1K generation at 256times256 resolution, PRA-S with 135M parameters achieves an FID of 2.58, surpassing the previous billion-scale pixel-space AR result of 3.60. Scaling to PRA-L with 511M parameters further improves FID to 1.94, establishing a new state of the art among pixel-space AR models. Beyond generation, PRA achieves higher ImageNet classification probing accuracy than other AR and diffusion baselines, suggesting its potential for unified pixel-space image generation and understanding.