Élucidation du biais SNR-t dans les modèles probabilistes de diffusion
Elucidating the SNR-t Bias of Diffusion Probabilistic Models
April 17, 2026
Auteurs: Meng Yu, Lei Sun, Jianhao Zeng, Xiangxiang Chu, Kun Zhan
cs.AI
Résumé
Les modèles probabilistes de diffusion ont démontré des performances remarquables dans un large éventail de tâches génératives. Cependant, nous avons observé que ces modèles souffrent souvent d'un biais lié au rapport signal-sur-bruit et au pas de temps (SNR-t). Ce biais désigne le désalignement entre le SNR de l'échantillon en cours de débruitage et son pas de temps correspondant durant la phase d'inférence. Plus précisément, pendant l'entraînement, le SNR d'un échantillon est strictement couplé à son pas de temps. Cependant, cette correspondance est perturbée lors de l'inférence, entraînant une accumulation d'erreurs et une dégradation de la qualité de génération. Nous fournissons des preuves empiriques complètes et une analyse théorique pour étayer ce phénomène et proposons une méthode de correction différentielle simple mais efficace pour atténuer le biais SNR-t. Considérant que les modèles de diffusion reconstruisent typiquement les composantes basse fréquence avant de se concentrer sur les détails haute fréquence durant le processus inverse de débruitage, nous décomposons les échantillons en diverses composantes fréquentielles et appliquons une correction différentielle à chaque composante individuellement. Des expériences approfondies montrent que notre approche améliore significativement la qualité de génération de divers modèles de diffusion (IDDPM, ADM, DDIM, A-DPM, EA-DPM, EDM, PFGM++ et FLUX) sur des jeux de données de diverses résolutions, avec une surcharge computationnelle négligeable. Le code est disponible à l'adresse https://github.com/AMAP-ML/DCW.
English
Diffusion Probabilistic Models have demonstrated remarkable performance across a wide range of generative tasks. However, we have observed that these models often suffer from a Signal-to-Noise Ratio-timestep (SNR-t) bias. This bias refers to the misalignment between the SNR of the denoising sample and its corresponding timestep during the inference phase. Specifically, during training, the SNR of a sample is strictly coupled with its timestep. However, this correspondence is disrupted during inference, leading to error accumulation and impairing the generation quality. We provide comprehensive empirical evidence and theoretical analysis to substantiate this phenomenon and propose a simple yet effective differential correction method to mitigate the SNR-t bias. Recognizing that diffusion models typically reconstruct low-frequency components before focusing on high-frequency details during the reverse denoising process, we decompose samples into various frequency components and apply differential correction to each component individually. Extensive experiments show that our approach significantly improves the generation quality of various diffusion models (IDDPM, ADM, DDIM, A-DPM, EA-DPM, EDM, PFGM++, and FLUX) on datasets of various resolutions with negligible computational overhead. The code is at https://github.com/AMAP-ML/DCW.