ChatPaper.aiChatPaper

Nemotron-Labs-Diffusion-Image: Vooruitgang in Gemaskeerde Discrete Diffusie voor Beeldgeneratie met Hoge Resolutie

Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis

June 29, 2026
Auteurs: Shufan Li, Greg Heinrich, Hanrong Ye, Yonggan Fu, Aditya Grover, Jan Kautz, Pavlo Molchanov
cs.AI

Samenvatting

Wij presenteren Nemotron-Labs-Diffusion-Image, een state-of-the-art gemaskeerd discreet diffusiemodel (MDM) voor hoogwaardige tekst-naar-beeldsynthese. Vergeleken met eerder werk op het gebied van gemaskeerde beeldgeneratie pakt Nemotron-Labs-Diffusion-Image twee belangrijke uitdagingen aan. Ten eerste, in tegenstelling tot continue diffusiemodellen die latente representaties stapsgewijs over het gehele beeld verfijnen, missen standaard MDM's het vermogen tot zelfcorrectie, omdat discrete tokens eenmaal onthuld niet meer kunnen worden gewijzigd. Ten tweede: hoewel het vergroten van de vocabulairegrootte van discrete beeldtokenizers de reconstructiekwaliteit verbetert, leidt dit tot optimalisatieproblemen voor generatieve modellering doordat het per-token trainingssignaal steeds schaarser wordt. Om de eerste uitdaging aan te pakken, bevat Nemotron-Labs-Diffusion-Image een token-bewerkingsmechanisme waarmee het model tijdens de inferentie dynamisch reeds onthulde tokens kan herzien, vergelijkbaar met hoe een beeldhouwer zijn werk iteratief verfijnt. Om de tweede uitdaging aan te gaan, stellen we een gegroepeerde cross-entropiedoelstelling (GCE) voor die positieve leersignalen toekent aan tokens die in de inbeddingsruimte naburig zijn aan de grondwaarheid, waardoor de signaalschaarste wordt verminderd. Om de trainingsefficiëntie verder te verbeteren, implementeren we een aangepaste gefuseerde operator voor GCE die het VRAM-gebruik in instellingen met grote vocabulaires aanzienlijk vermindert. Experimentele resultaten tonen aan dat deze innovaties zowel de trainingsefficiëntie als de beeldgetrouwheid van gemaskeerde discrete beeldgeneratoren aanzienlijk verbeteren, met scores van 0,90 op GenEval, 86,9 op DPG en 10,76 op HPSv3.
English
We propose Nemotron-Labs-Diffusion-Image, a state-of-the-art masked discrete diffusion model (MDM) for high-resolution text-to-image synthesis. Compared with prior work on masked image generation, Nemotron-Labs-Diffusion-Image addresses two key challenges. First, unlike continuous diffusion models which progressively refine latent representations across the entire image, standard MDMs lack self-correcting capability because discrete tokens cannot be modified once they are unmasked. Second, although increasing the vocabulary size of discrete image tokenizers improves reconstruction fidelity, it introduces optimization difficulties for generative modeling as the per-token training signal becomes increasingly sparse. To address the first challenge, Nemotron-Labs-Diffusion-Image incorporates a token-editing mechanism that enables the model to dynamically revise already-unmasked tokens during inference, similar to how a sculptor iteratively refines their work. To tackle the second challenge, we propose a Grouped Cross-Entropy (GCE) objective that assigns positive learning signals to tokens neighboring the ground truth in embedding space, thereby alleviating signal sparsity. To further improve training efficiency, we implement a custom fused operator for GCE that significantly reduces VRAM usage in large-vocabulary settings. Experimental results demonstrate that these innovations substantially improve both training efficiency and image fidelity of masked discrete image generators, achieving a score of 0.90 on GenEval, 86.9 on DPG and 10.76 of HPSv3.