ELF : Flux de langage embarqué
ELF: Embedded Language Flows
May 11, 2026
Auteurs: Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He
cs.AI
Résumé
Les modèles de diffusion et basés sur les flots sont devenus les approches de facto pour générer des données continues, par exemple dans des domaines tels que les images et les vidéos. Leur succès suscite un intérêt croissant pour leur application à la modélisation du langage. Contrairement à leurs homologues dédiés aux images, les modèles de diffusion pour le langage (DLMs) actuels opèrent principalement avec des jetons discrets. Dans cet article, nous montrons que les DLMs continus peuvent être rendus efficaces avec une adaptation minimale au domaine discret. Nous proposons Embedded Language Flows (ELF), une classe de modèles de diffusion dans un espace d'embedding continu, basée sur le Flow Matching en temps continu. Contrairement aux DLMs existants, ELF reste principalement dans l'espace d'embedding continu jusqu'à la dernière étape temporelle, où il effectue une projection vers des jetons discrets à l'aide d'un réseau à poids partagés. Cette formulation permet d'adapter directement des techniques établies issues des modèles de diffusion pour les images, par exemple la guidance sans classifieur (CFG). Les expériences montrent qu'ELF surpasse nettement les DLMs discrets et continus les plus performants, atteignant une meilleure qualité de génération avec moins d'étapes d'échantillonnage. Ces résultats suggèrent qu'ELF offre une voie prometteuse vers des DLMs continus efficaces.
English
Diffusion and flow-based models have become the de facto approaches for generating continuous data, e.g., in domains such as images and videos. Their success has attracted growing interest in applying them to language modeling. Unlike their image-domain counterparts, today's leading diffusion language models (DLMs) primarily operate over discrete tokens. In this paper, we show that continuous DLMs can be made effective with minimal adaptation to the discrete domain. We propose Embedded Language Flows (ELF), a class of diffusion models in continuous embedding space based on continuous-time Flow Matching. Unlike existing DLMs, ELF predominantly stays within the continuous embedding space until the final time step, where it maps to discrete tokens using a shared-weight network. This formulation makes it straightforward to adapt established techniques from image-domain diffusion models, e.g., classifier-free guidance (CFG). Experiments show that ELF substantially outperforms leading discrete and continuous DLMs, achieving better generation quality with fewer sampling steps. These results suggest that ELF offers a promising path toward effective continuous DLMs.