Calibri: Verbetering van Diffusie-Transformers via Parameter-Efficiënte Kalibratie
Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
March 25, 2026
Auteurs: Danil Tokhchukov, Aysel Mirzoeva, Andrey Kuznetsov, Konstantin Sobolev
cs.AI
Samenvatting
In dit artikel onthullen we het verborgen potentieel van Diffusion Transformers (DiTs) om generatieve taken aanzienlijk te verbeteren. Door een diepgaande analyse van het ruisverwijderingsproces tonen we aan dat de introductie van een enkele geleerde schaalparameter de prestaties van DiT-blokken aanzienlijk kan verbeteren. Voortbouwend op dit inzicht presenteren we Calibri, een parameter-efficiënte benadering die DiT-componenten optimaal kalibreert om de generatieve kwaliteit te verhogen. Calibri benadert DiT-kalibratie als een black-box beloningsoptimalisatieprobleem, dat efficiënt wordt opgelost met een evolutionair algoritme en slechts ~100 parameters wijzigt. Experimentele resultaten tonen aan dat Calibri, ondanks zijn lichtgewicht ontwerp, consistent de prestaties verbetert bij diverse tekst-naar-beeldmodellen. Opmerkelijk is dat Calibri ook het aantal benodigde inferentiestappen voor beeldgeneratie reduceert, terwijl het hoge kwaliteit van de output behoudt.
English
In this paper, we uncover the hidden potential of Diffusion Transformers (DiTs) to significantly enhance generative tasks. Through an in-depth analysis of the denoising process, we demonstrate that introducing a single learned scaling parameter can significantly improve the performance of DiT blocks. Building on this insight, we propose Calibri, a parameter-efficient approach that optimally calibrates DiT components to elevate generative quality. Calibri frames DiT calibration as a black-box reward optimization problem, which is efficiently solved using an evolutionary algorithm and modifies just ~100 parameters. Experimental results reveal that despite its lightweight design, Calibri consistently improves performance across various text-to-image models. Notably, Calibri also reduces the inference steps required for image generation, all while maintaining high-quality outputs.