Flash-BoN: Rascunhos Instantâneos para Escalonamento em Tempo de Inferência em Modelos de Difusão
Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
July 5, 2026
Autores: Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli
cs.AI
Resumo
O escalonamento em tempo de inferência para geração de texto para imagem evoluiu da simples amostragem Melhor-de-N (BoN) para métodos de busca guiada que verificam e direcionam trajetórias candidatas em etapas intermediárias de remoção de ruído. Essas abordagens focam em quando e com que frequência verificar durante a remoção de ruído, mas tratam em grande parte o custo da própria geração como fixo. Além disso, a prática padrão de comparar métodos pelo número de avaliações de função (NFEs) conta apenas as passagens diretas de remoção de ruído e ignora a sobrecarga do verificador, o que pode distorcer as classificações de eficiência. Mostramos que, sob avaliação em tempo real, o BoN simples já iguala ou supera diversas técnicas de busca guiada, sugerindo que o poder computacional é melhor empregado em exploração mais ampla do que em verificação intermediária repetida. Isso motiva o Flash-BoN, que gera um grande conjunto de candidatos de rascunho de baixo custo combinando três alavancas de aceleração complementares—truncamento de passos temporais, pulo de camadas e proxies de ativação—em uma única configuração otimizada uma vez por modelo. Um procedimento eficiente de verificação em múltiplos estágios identifica então o rascunho mais promissor, que é refinado em qualidade total. Em três benchmarks e três escalas de modelo, o Flash-BoN supera consistentemente todas as linhas de base sob orçamentos fixos de tempo real, com ganhos que aumentam em escalas de modelo maiores (+8% AUC). Mostramos ainda que nossa estratégia se combina bem e melhora técnicas ortogonais existentes, como otimização de prompts baseada em reflexão (+16% AUC). Os ganhos correlacionam-se com o aumento da diversidade de candidatos, o que também permite a seleção guiada por rascunho para acelerar a convergência do pós-treinamento por aprendizado por reforço.
English
Inference-time scaling for text-to-image generation has progressed from simple Best-of-N (BoN) sampling to guided search methods that verify and steer candidate trajectories at intermediate denoising steps. These approaches focus on when and how often to verify during denoising but largely treat the cost of generation itself as fixed. Moreover, the standard practice of comparing methods by number of function evaluations (NFEs) counts only denoising forward passes and ignores verifier overhead, which can distort efficiency rankings. We show that under wall-clock evaluation, simple BoN already matches or outperforms several guided search techniques, suggesting that compute is better spent on broader exploration than on repeated intermediate verification. This motivates Flash-BoN, which generates a large pool of inexpensive draft candidates by combining three complementary acceleration knobs: timestep truncation, layer skipping, and activation proxies into a single configuration optimized once per model. An efficient multi-stage verification procedure then identifies the most promising draft, which is refined at full quality. Across three benchmarks and three model scales, Flash-BoN consistently outperforms all baselines under fixed wall-clock budgets, with gains that grow at larger model scales (+8% AUC). We further show that our strategy combines well and improves existing orthogonal techniques such as reflection-based prompt optimization (+16% AUC). The gains correlate with increased candidate diversity, which also enables draft-guided selection to accelerate RL post-training convergence.