ChatPaper.aiChatPaper

DiffusionBench : Sur l'évaluation holistique des Transformers de diffusion

DiffusionBench: On Holistic Evaluation of Diffusion Transformers

June 23, 2026
Auteurs: Xingjian Leng, Jaskirat Singh, Zhanhao Liang, Ethan Smith, Martin Bell, Aninda Saha, Yuhui Yuan, Liang Zheng
cs.AI

Résumé

La recherche sur les transformateurs de diffusion (DiT) pour la génération d'images s'est concentrée sur un unique cadre d'évaluation : la génération conditionnée par classe sur ImageNet. Bien que les méthodes améliorent le FID et les métriques associées, il est de moins en moins clair si elles reflètent un réel progrès en modélisation générative. L'alternative naturelle, à savoir la génération texte-à-image (T2I), est perçue comme trop coûteuse ou peu pratique à entraîner et à évaluer, et est souvent négligée. Nous soutenons que cette perception n'est plus valable. Nous présentons NanoGen, un cadre unifié d'entraînement et d'évaluation pour DiT. NanoGen égalise les performances des références DiT de pointe sur ImageNet et, avec seulement 12 lignes de modification de configuration, entraîne également des modèles texte-à-image compétitifs. Il prend actuellement en charge les méthodes de diffusion RAE, VAE, espace pixel et MeanFlow, à la fois dans les configurations ImageNet et T2I. Avec NanoGen, l'entraînement T2I nécessite une puissance de calcul comparable à celle d'ImageNet. Après avoir entraîné 21 modèles de diffusion latente avec NanoGen, nous observons que le classement des méthodes ne montre aucune corrélation forte entre la génération ImageNet et T2I : la corrélation de Pearson se situe entre -0,377 et -0,580 sur trois métriques. Cela suggère qu'une méthode améliorant le FID conditionné par classe sur ImageNet peut ne montrer aucune amélioration correspondante sur T2I, indiquant clairement la nécessité d'évaluer les DiT sur les deux tâches. À cette fin, nous résumons les résultats sur ImageNet et la génération texte-à-image, ce qui donne DiffusionBench, un banc d'essai holistique pour la recherche sur les DiT. Nous recommandons de rapporter DiffusionBench plutôt qu'ImageNet seul : les méthodes qui améliorent DiffusionBench sont plus susceptibles de refléter un progrès plus large.
English
Diffusion transformer (DiT) research on image generation has converged to a single evaluation setup: class-conditional generation on ImageNet. While methods improve the FID and related metrics, it is increasingly unclear whether they reflect real progress in generative modeling. The natural alternative, i.e., text-to-image (T2I) generation, is perceived as too costly or inconvenient to train and evaluate and is often skipped. We argue that this perception no longer holds. We introduce NanoGen, a unified DiT training and evaluation framework. NanoGen matches state-of-the-art DiT baselines on ImageNet and, with 12 lines of configuration change, also trains competitive text-to-image models. It currently supports RAE, VAE, pixel-space, and MeanFlow diffusion methods under both ImageNet and T2I setups. Under NanoGen, training T2I requires comparable compute to ImageNet. After training 21 latent diffusion models with NanoGen, we observe that method ranking shows no strong correlation between ImageNet and T2I generation: Pearson correlation is between -0.377 and -0.580 across three metrics. This suggests that a method which improves class-conditional ImageNet FID may show no corresponding improvement on T2I, clearly indicating the necessity of evaluating DiTs on both tasks. To this end, we summarize ImageNet and text-to-image results, which yields DiffusionBench, a holistic benchmark for DiT research. We recommend reporting DiffusionBench in place of ImageNet alone: methods that improve DiffusionBench are more likely to reflect broader progress.