Representatie Distributie Matching voor Eénstaps Visuele Generatie
Representation Distribution Matching for One-Step Visual Generation
July 2, 2026
Auteurs: Lan Feng, Wuyang Li, Eloi Zablocki, Matthieu Cord, Alexandre Alahi
cs.AI
Samenvatting
Wij verhelderen de ontwerpruimte van Representation Distribution Matching (RDM), onze benaming voor het paradigma dat een eenstapsbeeldgenerator traint door gegenereerde en referentiekenmerkdistributies te matchen onder bevroren voorgetrainde encoders. We identificeren twee ontwerpassen – hoe de distributies worden vergeleken en de representaties waarin ze worden vergeleken – en gecontroleerde studies langs deze assen leveren drie bevindingen op. Ten eerste wordt de klassieke MMD, die tien jaar geleden geen overtuigende generatoren kon trainen, een sterke en schaalbare doelstelling zodra deze correct wordt geschat. Ten tweede is de gegenereerde batch dan de operationele variabele, met een optimum boven 2048, ver voorbij gebruikelijke batchgroottes. Ten derde kan elke afzonderlijke representatie worden omzeild, waarbij de score onder de echte waarde wordt gedreven terwijl afbeeldingen zichtbaar nep blijven; daarom matchen we tegen een evenwichtige batterij encoders en evalueren we met SW_r14, een Afgesneden Wasserstein-afstand over 14 encoders die onafhankelijk is van het trainingsverlies en weerstand biedt aan misleiding. Het combineren van de voorkeurskeuzen levert verbeterde RDM (iRDM) op: het stelt de eenstaps state-of-the-art op ImageNet op SW_r14 1,30, bevestigd door PickScore, een proxy voor menselijke voorkeur die ons doel nooit optimaliseert, en die het verkiest boven de eerdere beste eenstapsgenerator op 71,2% van de gematchte monsters. Hetzelfde recept traint de viertraps FLUX.2 [klein] na tot een eenstapsgenerator, die de viertrapsversie overtreft op GenEval, 0,826 tegen 0,794, en op PickScore, 22,76 tegen 22,58, in 90 H200 GPU-uren. Projectpagina: https://alan-lanfeng.github.io/rdm/.
English
We elucidate the design space of Representation Distribution Matching (RDM), our name for the paradigm that trains a one-step image generator by matching generated and reference feature distributions under frozen pretrained encoders. We identify two design axes, how the distributions are compared and the representations they are compared in, and controlled studies along them yield three findings. First, the classical MMD, which could not train convincing generators a decade ago, becomes a strong and scalable objective once estimated right. Second, the generated batch is then the operative variable, with an optimum above 2048, far beyond customary batch sizes. Third, any single representation can be gamed, driven below the real score while images stay visibly fake, so we match against a balanced battery of encoders and evaluate with SW_r14, a Sliced-Wasserstein distance over 14 encoders that is independent of the training loss and resists gaming. Combining the preferred choices yields improved RDM (iRDM): it sets the one-step state of the art on ImageNet at SW_r14 1.30, corroborated by PickScore, a human-preference proxy our objective never optimizes, which prefers it over the prior best one-step generator on 71.2% of matched samples. The same recipe post-trains the four-step FLUX.2 [klein] into a one-step generator, surpassing the four-step version on GenEval, 0.826 to 0.794, and on PickScore, 22.76 to 22.58, in 90 H200 GPU-hours. Project page: https://alan-lanfeng.github.io/rdm/.