Flash-BoN: Snelle Schetsen voor Inferentietijd-schaling in Diffusiemodellen
Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
July 5, 2026
Auteurs: Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli
cs.AI
Samenvatting
Inferentie-tijdsschaalvergroting voor tekst-naar-beeldgeneratie is geëvolueerd van eenvoudige Best-of-N (BoN) sampling naar begeleide zoekmethoden die kandidaattrajecten verifiëren en sturen tijdens tussenliggende denoisingstappen. Deze benaderingen richten zich op wanneer en hoe vaak er wordt geverifieerd tijdens het denoisingproces, maar beschouwen de kosten van de generatie zelf grotendeels als vast. Bovendien telt de standaardpraktijk van het vergelijken van methoden op basis van het aantal functie-evaluaties (NFEs) alleen de denoising forward passes en negeert de overhead van de verificateur, wat de efficiëntieranglijsten kan vertekenen. We tonen aan dat onder wandklok-evaluatie eenvoudige BoN al even goed of beter presteert dan verschillende begeleide zoektechnieken, wat suggereert dat rekenkracht beter besteed kan worden aan bredere exploratie dan aan herhaalde tussenliggende verificatie.
Dit motiveert Flash-BoN, dat een grote pool van goedkope conceptkandidaten genereert door drie complementaire versnellingsknoppen te combineren: tijdstap-truncatie, laagoverslaan en activatieproxy's in één configuratie die eenmalig per model wordt geoptimaliseerd. Een efficiënte meerfasige verificatieprocedure identificeert vervolgens het meest veelbelovende concept, dat op volledige kwaliteit wordt verfijnd. Over drie benchmarks en drie modelschalen heen presteert Flash-BoN consequent beter dan alle baselines onder vaste wandklok-budgetten, met winsten die toenemen bij grotere modelschalen (+8% AUC). Verder tonen we aan dat onze strategie goed combineert met en bestaande orthogonale technieken zoals reflectie-gebaseerde promptoptimalisatie verbetert (+16% AUC). De winsten correleren met een verhoogde kandidaatdiversiteit, wat ook concept-geleide selectie mogelijk maakt om RL-post-training convergentie te versnellen.
English
Inference-time scaling for text-to-image generation has progressed from simple Best-of-N (BoN) sampling to guided search methods that verify and steer candidate trajectories at intermediate denoising steps. These approaches focus on when and how often to verify during denoising but largely treat the cost of generation itself as fixed. Moreover, the standard practice of comparing methods by number of function evaluations (NFEs) counts only denoising forward passes and ignores verifier overhead, which can distort efficiency rankings. We show that under wall-clock evaluation, simple BoN already matches or outperforms several guided search techniques, suggesting that compute is better spent on broader exploration than on repeated intermediate verification. This motivates Flash-BoN, which generates a large pool of inexpensive draft candidates by combining three complementary acceleration knobs: timestep truncation, layer skipping, and activation proxies into a single configuration optimized once per model. An efficient multi-stage verification procedure then identifies the most promising draft, which is refined at full quality. Across three benchmarks and three model scales, Flash-BoN consistently outperforms all baselines under fixed wall-clock budgets, with gains that grow at larger model scales (+8% AUC). We further show that our strategy combines well and improves existing orthogonal techniques such as reflection-based prompt optimization (+16% AUC). The gains correlate with increased candidate diversity, which also enables draft-guided selection to accelerate RL post-training convergence.