ChatPaper.aiChatPaper

Flash-BoN : Ébauches instantanées pour le scaling au moment de l'inférence dans les modèles de diffusion

Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

July 5, 2026
Auteurs: Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli
cs.AI

Résumé

Le scaling lors de l’inférence pour la génération texte-image est passé d’un simple échantillonnage Best-of-N (BoN) à des méthodes de recherche guidée qui vérifient et orientent les trajectoires candidates à des étapes de débruitage intermédiaires. Ces approches se concentrent sur le moment et la fréquence de la vérification pendant le débruitage, mais traitent largement le coût de la génération elle-même comme fixe. De plus, la pratique standard consistant à comparer les méthodes par le nombre d’évaluations de fonction (NFEs) ne compte que les passages avant du débruitage et ignore le surcoût du vérificateur, ce qui peut fausser les classements d’efficacité. Nous montrons que, sous une évaluation en temps réel, un BoN simple atteint déjà ou surpasse plusieurs techniques de recherche guidée, suggérant qu’il est préférable de consacrer le calcul à une exploration plus large plutôt qu’à des vérifications intermédiaires répétées. Cela motive Flash-BoN, qui génère un large réservoir de candidats ébauches peu coûteux en combinant trois paramètres d’accélération complémentaires — troncature des pas de temps, saut de couches et proxys d’activation — en une configuration unique optimisée une fois par modèle. Une procédure de vérification multi-étapes efficace identifie ensuite l’ébauche la plus prometteuse, qui est raffinée en pleine qualité. Sur trois benchmarks et trois échelles de modèle, Flash-BoN surpasse systématiquement toutes les méthodes de référence sous des budgets de temps d’exécution fixes, avec des gains qui augmentent avec l’échelle du modèle (+8 % d’AUC). Nous montrons également que notre stratégie se combine bien et améliore des techniques orthogonales existantes telles que l’optimisation de prompt basée sur la réflexion (+16 % d’AUC). Les gains sont corrélés à une diversité accrue des candidats, ce qui permet également à la sélection guidée par ébauche d’accélérer la convergence du post-entraînement par apprentissage par renforcement.
English
Inference-time scaling for text-to-image generation has progressed from simple Best-of-N (BoN) sampling to guided search methods that verify and steer candidate trajectories at intermediate denoising steps. These approaches focus on when and how often to verify during denoising but largely treat the cost of generation itself as fixed. Moreover, the standard practice of comparing methods by number of function evaluations (NFEs) counts only denoising forward passes and ignores verifier overhead, which can distort efficiency rankings. We show that under wall-clock evaluation, simple BoN already matches or outperforms several guided search techniques, suggesting that compute is better spent on broader exploration than on repeated intermediate verification. This motivates Flash-BoN, which generates a large pool of inexpensive draft candidates by combining three complementary acceleration knobs: timestep truncation, layer skipping, and activation proxies into a single configuration optimized once per model. An efficient multi-stage verification procedure then identifies the most promising draft, which is refined at full quality. Across three benchmarks and three model scales, Flash-BoN consistently outperforms all baselines under fixed wall-clock budgets, with gains that grow at larger model scales (+8% AUC). We further show that our strategy combines well and improves existing orthogonal techniques such as reflection-based prompt optimization (+16% AUC). The gains correlate with increased candidate diversity, which also enables draft-guided selection to accelerate RL post-training convergence.