ChatPaper.aiChatPaper

Dystruct : Décodage de modèle de langage à diffusion à structure dynamique via l'inférence bayésienne

Dystruct: Dynamically Structured Diffusion Language Model Decoding via Bayesian Inference

May 10, 2026
Auteurs: Bian Sun, Kevin Zhai, Mubarak Shah, Zhenyi Wang
cs.AI

Résumé

Les modèles de langage par diffusion (DLM) sont récemment apparus comme une alternative prometteuse aux modèles autorégressifs, principalement en raison de leur capacité à permettre un décodage parallèle. Malgré cet avantage, la plupart des DLM existants reposent sur une longueur de génération fixe définie avant le décodage, ce qui limite leur flexibilité dans les applications réelles. Bien que quelques travaux récents tentent de prendre en charge la génération à longueur variable, ils souffrent généralement de limitations notables : certains nécessitent un réentraînement coûteux pour s'adapter à des sorties de longueur variable, tandis que d'autres dépendent uniquement de signaux de confiance locaux lors du décodage. Ces critères locaux ne parviennent pas à capturer la structure évolutive de la séquence, ce qui conduit souvent à une qualité de génération sous-optimale. Dans cet article, nous proposons un cadre de décodage structuré bayésien, sans entraînement, qui formule la génération à longueur flexible comme un problème d'inférence structurelle dynamique. Notre approche formalise la génération à longueur variable comme un problème d'inférence structurelle dynamique, en calculant conjointement la longueur d'expansion, les limites des blocs et le calendrier de décodage. À chaque étape d'expansion de fenêtre, la méthode intègre l'incertitude locale aux signaux structurels via un mécanisme unifié qui prend en charge la génération structurée dynamique, incluant à la fois l'expansion flexible des blocs et l'organisation des blocs, tout en maintenant la cohérence. Des expériences approfondies sur plusieurs benchmarks démontrent que notre approche améliore considérablement la qualité et la flexibilité de la génération par rapport aux références existantes à longueur fixe et variable. Ces résultats soulignent l'avantage du décodage structuré bayésien pour les modèles de langage par diffusion, offrant une solution à la fois rigoureuse et efficace pour la génération de texte structuré.
English
Diffusion language models (DLMs) have recently emerged as a promising alternative to autoregressive models, primarily due to their ability to enable parallel decoding. Despite this advantage, most existing DLMs rely on a fixed generation length specified prior to decoding, which restricts their flexibility in real-world applications. While a few recent works attempt to support flexible-length generation, they typically suffer from notable limitations: some require costly retraining to accommodate variable-length outputs, while others depend solely on local confidence signals during decoding. Such local criteria fail to capture the evolving structure of the sequence, often resulting in suboptimal generation quality. In this paper, we propose a training-free, Bayesian structured decoding framework that formulates flexible-length generation as a dynamic structural inference problem. Our approach formulates flexible-length generation as a dynamic structural inference problem, jointly computing the expansion length, the block boundaries, and the decoding schedule. At each window expansion step, the method integrates local uncertainty with structural signals via a unified mechanism that supports dynamic structured generation, including both flexible block expansion and block organization, while maintaining coherence. Extensive experiments across multiple benchmarks demonstrate that our approach significantly improves generation quality and flexibility over existing fixed-length and flexible-length baselines. These results highlight the advantage of Bayesian structured decoding for diffusion language model, providing a principled and efficient solution for structured text generation.