AAD-1 : Distillation Adversariale Asymétrique pour la Génération de Vidéos Autorégressive en une Étape
AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation
June 2, 2026
Auteurs: Haobo Li, Yanhong Zeng, Yunhong Lu, Jiapeng Zhu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yujun Shen, Zhipeng Zhang
cs.AI
Résumé
Nous présentons AAD-1, un cadre de distillation adverse asymétrique pour la génération autorégressive d’images en vidéos en une étape. Les méthodes de pointe actuelles utilisent la distillation adverse mais souffrent d’effondrement du mouvement et d’instabilité d’entraînement, conduisant à des vidéos statiques. AAD-1 répond à ces défis grâce à deux conceptions clés dans l’architecture et la stratégie d’entraînement. Notre principal apport architectural consiste à briser la symétrie entre le générateur et le discriminateur. Alors que le générateur reste causal afin de préserver la capacité d’échantillonnage autorégressif, le discriminateur examine bidirectionnellement l’ensemble du contexte spatiotemporel et produit un score unique de réalisme holistique pour la séquence vidéo entière. Cette conception asymétrique permet au discriminateur de détecter efficacement les défaillances temporelles globales et les dérives à longue portée qui provoquent l’effondrement du mouvement dans la génération autorégressive. Pour stabiliser l’entraînement, nous introduisons une stratégie par phases qui commence par une correspondance de distribution pour amorcer un générateur stable en une étape, offrant une phase d’échauffement qui rapproche la distribution de l’étudiant de celle de l’enseignant avant le début de la distillation adverse. Des expériences approfondies sur VBench montrent qu’AAD-1 atteint des performances de pointe dans la génération vidéo autorégressive en une étape.
English
We present AAD-1, an Asymmetric Adversarial Distillation framework for One-step autoregressive image-to-video generation. State-of-the-art methods adopt adversarial distillation but suffer from motion collapse and training instability, resulting in static videos. AAD-1 addresses these challenges through two key designs in architecture and training strategy. Our key architectural insight is to break the symmetry between generator and discriminator. While the generator remains causal to preserve autoregressive sampling capability, the discriminator attends bidirectionally over the full spatiotemporal context and produces a single holistic realism score for the entire video sequence. This asymmetric design enables the discriminator to effectively detect global temporal failures and long-range drift that cause motion collapse in autoregressive generation. To stabilize training, we introduce a phased strategy that first uses distribution matching to bootstrap a stable one-step generator, providing a warm-up phase that brings the student distribution closer to the teacher before adversarial distillation begins. Extensive experiments on VBench demonstrate that AAD-1 achieves state-of-the-art performance in one-step autoregressive video generation.