Flash-BoN: Borradores Instantáneos para el Escalado en Tiempo de Inferencia en Modelos de Difusión
Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
July 5, 2026
Autores: Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli
cs.AI
Resumen
El escalado en tiempo de inferencia para la generación de texto a imagen ha evolucionado desde el simple muestreo Best-of-N (BoN) hasta métodos de búsqueda guiada que verifican y dirigen trayectorias candidatas en pasos intermedios de eliminación de ruido. Estos enfoques se centran en cuándo y con qué frecuencia verificar durante la eliminación de ruido, pero en gran medida tratan el costo de la generación como fijo. Además, la práctica estándar de comparar métodos mediante el número de evaluaciones de función (NEF) solo contabiliza los pases directos de eliminación de ruido e ignora la sobrecarga del verificador, lo que puede distorsionar las clasificaciones de eficiencia. Demostramos que, bajo una evaluación en tiempo real, el BoN simple ya iguala o supera a varias técnicas de búsqueda guiada, lo que sugiere que el cómputo se invierte mejor en una exploración más amplia que en verificaciones intermedias repetidas. Esto motiva Flash-BoN, que genera un gran conjunto de candidatos preliminares de bajo costo combinando tres mecanismos de aceleración complementarios: truncamiento de pasos temporales, salto de capas y aproximaciones de activación en una única configuración optimizada una vez por modelo. Un procedimiento eficiente de verificación en múltiples etapas identifica entonces el candidato preliminar más prometedor, que se refina con calidad completa. En tres puntos de referencia y tres escalas de modelo, Flash-BoN supera consistentemente a todas las líneas base bajo presupuestos de tiempo real fijos, con ganancias que crecen en escalas de modelo mayores (+8% AUC). Además, mostramos que nuestra estrategia se combina bien y mejora técnicas ortogonales existentes como la optimización de indicaciones basada en reflexión (+16% AUC). Las ganancias se correlacionan con una mayor diversidad de candidatos, lo que también permite que la selección guiada por preliminares acelere la convergencia del entrenamiento posterior con RL.
English
Inference-time scaling for text-to-image generation has progressed from simple Best-of-N (BoN) sampling to guided search methods that verify and steer candidate trajectories at intermediate denoising steps. These approaches focus on when and how often to verify during denoising but largely treat the cost of generation itself as fixed. Moreover, the standard practice of comparing methods by number of function evaluations (NFEs) counts only denoising forward passes and ignores verifier overhead, which can distort efficiency rankings. We show that under wall-clock evaluation, simple BoN already matches or outperforms several guided search techniques, suggesting that compute is better spent on broader exploration than on repeated intermediate verification. This motivates Flash-BoN, which generates a large pool of inexpensive draft candidates by combining three complementary acceleration knobs: timestep truncation, layer skipping, and activation proxies into a single configuration optimized once per model. An efficient multi-stage verification procedure then identifies the most promising draft, which is refined at full quality. Across three benchmarks and three model scales, Flash-BoN consistently outperforms all baselines under fixed wall-clock budgets, with gains that grow at larger model scales (+8% AUC). We further show that our strategy combines well and improves existing orthogonal techniques such as reflection-based prompt optimization (+16% AUC). The gains correlate with increased candidate diversity, which also enables draft-guided selection to accelerate RL post-training convergence.