ChatPaper.aiChatPaper

DiffusionBench: Sobre Avaliação Holística de Transformadores de Difusão

DiffusionBench: On Holistic Evaluation of Diffusion Transformers

June 23, 2026
Autores: Xingjian Leng, Jaskirat Singh, Zhanhao Liang, Ethan Smith, Martin Bell, Aninda Saha, Yuhui Yuan, Liang Zheng
cs.AI

Resumo

A pesquisa sobre o transformer de difusão (DiT) para geração de imagens convergiu para uma única configuração de avaliação: geração condicionada por classe no ImageNet. Embora os métodos melhorem o FID e métricas relacionadas, torna-se cada vez menos claro se eles refletem o progresso real em modelagem generativa. A alternativa natural, ou seja, a geração texto-imagem (T2I), é percebida como demasiado dispendiosa ou inconveniente para treinar e avaliar, sendo frequentemente ignorada. Argumentamos que essa percepção já não se sustenta. Apresentamos o NanoGen, uma estrutura unificada de treino e avaliação para DiT. O NanoGen corresponde aos baselines de DiT de última geração no ImageNet e, com 12 linhas de alteração na configuração, também treina modelos competitivos de texto-imagem. Atualmente, suporta métodos de difusão RAE, VAE, espaço de pixels e MeanFlow tanto em configurações ImageNet como T2I. Com o NanoGen, o treino de T2I requer uma quantidade de computação comparável à do ImageNet. Após treinar 21 modelos de difusão latente com o NanoGen, observamos que a classificação dos métodos não mostra correlação forte entre a geração ImageNet e T2I: a correlação de Pearson situa-se entre -0,377 e -0,580 para as três métricas. Isto sugere que um método que melhora o FID condicionado por classe no ImageNet pode não apresentar melhoria correspondente no T2I, indicando claramente a necessidade de avaliar os DiTs em ambas as tarefas. Para esse fim, resumimos os resultados do ImageNet e de texto-imagem, dando origem ao DiffusionBench, um benchmark holístico para a investigação em DiT. Recomendamos relatar o DiffusionBench em vez apenas do ImageNet: métodos que melhoram o DiffusionBench têm maior probabilidade de refletir um progresso mais amplo.
English
Diffusion transformer (DiT) research on image generation has converged to a single evaluation setup: class-conditional generation on ImageNet. While methods improve the FID and related metrics, it is increasingly unclear whether they reflect real progress in generative modeling. The natural alternative, i.e., text-to-image (T2I) generation, is perceived as too costly or inconvenient to train and evaluate and is often skipped. We argue that this perception no longer holds. We introduce NanoGen, a unified DiT training and evaluation framework. NanoGen matches state-of-the-art DiT baselines on ImageNet and, with 12 lines of configuration change, also trains competitive text-to-image models. It currently supports RAE, VAE, pixel-space, and MeanFlow diffusion methods under both ImageNet and T2I setups. Under NanoGen, training T2I requires comparable compute to ImageNet. After training 21 latent diffusion models with NanoGen, we observe that method ranking shows no strong correlation between ImageNet and T2I generation: Pearson correlation is between -0.377 and -0.580 across three metrics. This suggests that a method which improves class-conditional ImageNet FID may show no corresponding improvement on T2I, clearly indicating the necessity of evaluating DiTs on both tasks. To this end, we summarize ImageNet and text-to-image results, which yields DiffusionBench, a holistic benchmark for DiT research. We recommend reporting DiffusionBench in place of ImageNet alone: methods that improve DiffusionBench are more likely to reflect broader progress.