ChatPaper.aiChatPaper

Flash-BoN: Мгновенные черновики для масштабирования во время инференса в диффузионных моделях

Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

July 5, 2026
Авторы: Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli
cs.AI

Аннотация

Масштабирование времени логического вывода для генерации изображений по текстовому описанию эволюционировало от простой выборки "лучший из N" (Best-of-N, BoN) до направленных методов поиска, которые проверяют и направляют кандидатные траектории на промежуточных этапах шумоподавления. Эти подходы сосредоточены на том, когда и как часто проводить проверку в процессе шумоподавления, но в значительной степени рассматривают стоимость самой генерации как фиксированную. Более того, стандартная практика сравнения методов по количеству вычислений функции (Number of Function Evaluations, NFEs) учитывает только прямые проходы шумоподавления и игнорирует накладные расходы на проверку, что может искажать рейтинги эффективности. Мы показываем, что при оценке по реальному времени простая BoN уже сравнивается или превосходит несколько направленных методов поиска, что позволяет предположить, что вычислительные ресурсы лучше тратить на более широкое исследование, чем на повторные промежуточные проверки. Это мотивирует разработку Flash-BoN, который генерирует большой пул недорогих черновых кандидатов, комбинируя три взаимодополняющих регулятора ускорения: усечение временных шагов, пропуск слоев и прокси активаций — в единую конфигурацию, оптимизируемую один раз для каждой модели. Затем эффективная многоэтапная процедура проверки определяет наиболее перспективный черновик, который уточняется с полным качеством. На трех эталонных наборах данных и для трех масштабов моделей Flash-BoN стабильно превосходит все базовые методы при фиксированных бюджетах реального времени, причем выигрыш возрастает с увеличением масштаба модели (+8% AUC). Мы также показываем, что наша стратегия хорошо сочетается с существующими ортогональными методами, такими как оптимизация подсказок на основе рефлексии, и улучшает их (+16% AUC). Полученные выигрыши коррелируют с возросшим разнообразием кандидатов, что также позволяет использовать черновой отбор для ускорения сходимости последующего обучения с подкреплением.
English
Inference-time scaling for text-to-image generation has progressed from simple Best-of-N (BoN) sampling to guided search methods that verify and steer candidate trajectories at intermediate denoising steps. These approaches focus on when and how often to verify during denoising but largely treat the cost of generation itself as fixed. Moreover, the standard practice of comparing methods by number of function evaluations (NFEs) counts only denoising forward passes and ignores verifier overhead, which can distort efficiency rankings. We show that under wall-clock evaluation, simple BoN already matches or outperforms several guided search techniques, suggesting that compute is better spent on broader exploration than on repeated intermediate verification. This motivates Flash-BoN, which generates a large pool of inexpensive draft candidates by combining three complementary acceleration knobs: timestep truncation, layer skipping, and activation proxies into a single configuration optimized once per model. An efficient multi-stage verification procedure then identifies the most promising draft, which is refined at full quality. Across three benchmarks and three model scales, Flash-BoN consistently outperforms all baselines under fixed wall-clock budgets, with gains that grow at larger model scales (+8% AUC). We further show that our strategy combines well and improves existing orthogonal techniques such as reflection-based prompt optimization (+16% AUC). The gains correlate with increased candidate diversity, which also enables draft-guided selection to accelerate RL post-training convergence.