ELF: Fluxos de Linguagem Embutidos
ELF: Embedded Language Flows
May 11, 2026
Autores: Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He
cs.AI
Resumo
Modelos de difusão e baseados em fluxo tornaram-se as abordagens padrão para gerar dados contínuos, por exemplo, em domínios como imagens e vídeos. Seu sucesso tem atraído um interesse crescente em aplicá-los à modelagem de linguagem. Diferentemente de seus equivalentes no domínio de imagens, os principais modelos de difusão de linguagem (DLMs) atuais operam predominantemente sobre tokens discretos. Neste artigo, mostramos que DLMs contínuos podem ser tornados eficazes com adaptação mínima ao domínio discreto. Propomos os Fluxos de Linguagem Incorporados (ELF), uma classe de modelos de difusão no espaço de incorporação contínua baseada em Correspondência de Fluxo em Tempo Contínuo. Diferentemente dos DLMs existentes, o ELF permanece predominantemente no espaço de incorporação contínua até o passo temporal final, onde mapeia para tokens discretos usando uma rede de pesos compartilhados. Essa formulação torna simples a adaptação de técnicas estabelecidas de modelos de difusão do domínio de imagens, por exemplo, a orientação livre de classificador (CFG). Experimentos mostram que o ELF supera substancialmente os principais DLMs discretos e contínuos, alcançando melhor qualidade de geração com menos etapas de amostragem. Esses resultados sugerem que o ELF oferece um caminho promissor para DLMs contínuos eficazes.
English
Diffusion and flow-based models have become the de facto approaches for generating continuous data, e.g., in domains such as images and videos. Their success has attracted growing interest in applying them to language modeling. Unlike their image-domain counterparts, today's leading diffusion language models (DLMs) primarily operate over discrete tokens. In this paper, we show that continuous DLMs can be made effective with minimal adaptation to the discrete domain. We propose Embedded Language Flows (ELF), a class of diffusion models in continuous embedding space based on continuous-time Flow Matching. Unlike existing DLMs, ELF predominantly stays within the continuous embedding space until the final time step, where it maps to discrete tokens using a shared-weight network. This formulation makes it straightforward to adapt established techniques from image-domain diffusion models, e.g., classifier-free guidance (CFG). Experiments show that ELF substantially outperforms leading discrete and continuous DLMs, achieving better generation quality with fewer sampling steps. These results suggest that ELF offers a promising path toward effective continuous DLMs.