ChatPaper.aiChatPaper

AnyFlow : modèle de diffusion vidéo à nombre d'étapes arbitraire avec distillation de cartes de flux on-policy

AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation

May 13, 2026
Auteurs: Yuchao Gu, Guian Fang, Yuxin Jiang, Weijia Mao, Song Han, Han Cai, Mike Zheng Shou
cs.AI

Résumé

La génération vidéo en quelques étapes a été considérablement améliorée par la distillation de cohérence. Cependant, les performances des modèles distillés par cohérence se dégradent souvent lorsque davantage d'étapes d'échantillonnage sont allouées au moment du test, limitant ainsi leur efficacité pour la diffusion vidéo à nombre d'étapes quelconque. Cette limitation provient du fait que la distillation de cohérence remplace la trajectoire originale de l'EDO de flux de probabilité par une trajectoire d'échantillonnage de cohérence, affaiblissant le comportement souhaitable de passage à l'échelle de l'échantillonnage par EDO lors du test. Pour remédier à cette limitation, nous introduisons AnyFlow, le premier cadre de distillation de diffusion vidéo à nombre d'étapes quelconque, basé sur des cartes de flot. Au lieu de distiller un modèle pour seulement quelques étapes d'échantillonnage fixes, AnyFlow optimise la trajectoire complète d'échantillonnage par EDO. À cette fin, nous déplaçons l'objectif de distillation de l'application de cohérence de point final (z_{t}rightarrow z_{0}) vers l'apprentissage de transition par carte de flot (z_{t}rightarrow z_{r}) sur des intervalles de temps arbitraires. Nous proposons également la simulation rétrograde par carte de flot, qui décompose un déroulement complet d'Euler en transitions de carte de flot raccourcies, permettant une distillation on-policy efficace qui réduit les erreurs au moment du test (c'est-à-dire l'erreur de discrétisation dans l'échantillonnage en quelques étapes et le biais d'exposition dans la génération causale). Des expériences approfondies sur des architectures bidirectionnelles et causales, à des échelles allant de 1,3 à 14 milliards de paramètres, démontrent qu'AnyFlow atteint des performances égales ou supérieures à celles des modèles basés sur la cohérence dans le régime à quelques étapes, tout en passant à l'échelle avec les budgets d'étapes d'échantillonnage.
English
Few-step video generation has been significantly advanced by consistency distillation. However, the performance of consistency-distilled models often degrades as more sampling steps are allocated at test time, limiting their effectiveness for any-step video diffusion. This limitation arises because consistency distillation replaces the original probability-flow ODE trajectory with a consistency-sampling trajectory, weakening the desirable test-time scaling behavior of ODE sampling. To address this limitation, we introduce AnyFlow, the first any-step video diffusion distillation framework based on flow maps. Instead of distilling a model for only a few fixed sampling steps, AnyFlow optimizes the full ODE sampling trajectory. To this end, we shift the distillation target from endpoint consistency mapping (z_{t}rightarrow z_{0}) to flow-map transition learning (z_{t}rightarrow z_{r}) over arbitrary time intervals. We further propose Flow Map Backward Simulation, which decomposes a full Euler rollout into shortcut flow-map transitions, enabling efficient on-policy distillation that reduces test-time errors (i.e., discretization error in few-step sampling and exposure bias in causal generation). Extensive experiments across both bidirectional and causal architectures, at scales ranging from 1.3B to 14B parameters, demonstrate that AnyFlow achieves performance matches or surpasses consistency-based counterparts in the few-step regime, while scaling with sampling step budgets.