Modelo de Linguagem de Difusão Latente Contínua
Continuous Latent Diffusion Language Model
May 7, 2026
Autores: Hongcan Guo, Qinyu Zhao, Yian Zhao, Shen Nie, Rui Zhu, Qiushan Guo, Feng Wang, Tao Yang, Hengshuang Zhao, Guoqiang Wei, Yan Zeng
cs.AI
Resumo
Os modelos de linguagem de grande escala alcançaram sucesso notável sob o paradigma autoregressivo, porém a geração de texto de alta qualidade não precisa estar vinculada a uma ordem fixa da esquerda para a direita. As alternativas existentes ainda lutam para alcançar conjuntamente eficiência de geração, aprendizado de representação escalável e modelagem semântica global eficaz. Propomos o Cola DLM, um modelo de linguagem de difusão latente hierárquico que estrutura a geração de texto através da decomposição hierárquica de informação. O Cola DLM primeiro aprende um mapeamento estável de texto para latente com um VAE de Texto, depois modela um *prior* semântico global em espaço latente contínuo com um DiT de causalidade em bloco e, finalmente, gera texto através de decodificação condicional. De uma perspectiva unificada de caminho markoviano, seu processo de difusão realiza transporte de *prior* latente em vez de recuperação de observação a nível de *token*, separando assim a organização semântica global da realização textual local. Este projeto produz um viés indutivo não autoregressivo mais flexível, suporta compressão semântica e ajuste de *prior* em espaço contínuo e estende-se naturalmente a outras modalidades contínuas. Através de experimentos abrangendo 4 questões de pesquisa, 8 *benchmarks*, linhas de base autoregressivas e LLaDA estritamente pareadas com ~2B de parâmetros, e curvas de escala até cerca de 2000 EFLOPs, identificamos uma configuração geral eficaz do Cola DLM e verificamos seu forte comportamento de escala para geração de texto. Em conjunto, os resultados estabelecem a modelagem hierárquica contínua de *prior* latente como uma alternativa fundamentada à modelagem de linguagem estritamente a nível de *token*, onde a qualidade de geração e o comportamento de escala podem refletir melhor a capacidade do modelo do que a verossimilhança, ao mesmo tempo que sugerem um caminho concreto para a modelagem unificada entre texto discreto e modalidades contínuas.
English
Large language models have achieved remarkable success under the autoregressive paradigm, yet high-quality text generation need not be tied to a fixed left-to-right order. Existing alternatives still struggle to jointly achieve generation efficiency, scalable representation learning, and effective global semantic modeling. We propose Cola DLM, a hierarchical latent diffusion language model that frames text generation through hierarchical information decomposition. Cola DLM first learns a stable text-to-latent mapping with a Text VAE, then models a global semantic prior in continuous latent space with a block-causal DiT, and finally generates text through conditional decoding. From a unified Markov-path perspective, its diffusion process performs latent prior transport rather than token-level observation recovery, thereby separating global semantic organization from local textual realization. This design yields a more flexible non-autoregressive inductive bias, supports semantic compression and prior fitting in continuous space, and naturally extends to other continuous modalities. Through experiments spanning 4 research questions, 8 benchmarks, strictly matched ~2B-parameter autoregressive and LLaDA baselines, and scaling curves up to about 2000 EFLOPs, we identify an effective overall configuration of Cola DLM and verify its strong scaling behavior for text generation. Taken together, the results establish hierarchical continuous latent prior modeling as a principled alternative to strictly token-level language modeling, where generation quality and scaling behavior may better reflect model capability than likelihood, while also suggesting a concrete path toward unified modeling across discrete text and continuous modalities.