Modèles d'écoulement asymétrique
Asymmetric Flow Models
May 13, 2026
Auteurs: Hansheng Chen, Jan Ackermann, Minseo Kim, Gordon Wetzstein, Leonidas Guibas
cs.AI
Résumé
La génération par flot dans des espaces de haute dimension est difficile car la prédiction de vélocité nécessite de modéliser un bruit de haute dimension, même lorsque les données présentent une forte structure de faible rang. Nous présentons la modélisation de flot asymétrique (AsymFlow), une paramétrisation de vélocité asymétrique en rang qui restreint la prédiction du bruit à un sous-espace de faible rang tout en conservant une prédiction des données en pleine dimension. À partir de cette prédiction asymétrique, AsymFlow récupère analytiquement la vélocité en pleine dimension sans modifier l'architecture du réseau ni les procédures d'entraînement ou d'échantillonnage. Sur ImageNet 256×256, AsymFlow atteint un FID de pointe de 1,57, surpassant largement les modèles de diffusion de pixels antérieurs de type DiT/JiT. AsymFlow offre également la toute première voie pour affiner des modèles de flot latents pré-entraînés en modèles d'espace pixel : l'alignement du sous-espace pixel de faible rang sur l'espace latent donne une initialisation transparente qui préserve la sémantique et la structure de haut niveau du modèle latent, de sorte que l'affinage améliore principalement les inadéquations de bas niveau plutôt que de réapprendre la génération de pixels. Nous montrons que le modèle AsymFlow pixel affiné à partir de FLUX.2 klein 9B établit un nouvel état de l'art pour la génération texte-image dans l'espace pixel, surpassant sa base latente sur HPSv3, DPG-Bench et GenEval tout en montrant qualitativement un réalisme visuel considérablement amélioré.
English
Flow-based generation in high-dimensional spaces is difficult because velocity prediction requires modeling high-dimensional noise, even when data has strong low-rank structure. We present Asymmetric Flow Modeling (AsymFlow), a rank-asymmetric velocity parameterization that restricts noise prediction to a low-rank subspace while keeping data prediction full-dimensional. From this asymmetric prediction, AsymFlow analytically recovers the full-dimensional velocity without changing the network architecture or training/sampling procedures. On ImageNet 256times256, AsymFlow achieves a leading 1.57 FID, outperforming prior DiT/JiT-like pixel diffusion models by a large margin. AsymFlow also provides the first-ever route for finetuning pretrained latent flow models into pixel-space models: aligning the low-rank pixel subspace to the latent space gives a seamless initialization that preserves the latent model's high-level semantics and structure, so finetuning mainly improves low-level mismatches rather than relearning pixel generation. We show that the pixel AsymFlow model finetuned from FLUX.2 klein 9B establishes a new state of the art for pixel-space text-to-image generation, beating its latent base on HPSv3, DPG-Bench, and GenEval while qualitatively showing substantially improved visual realism.