Dystruct: Dynamisch gestructureerd diffusietaalmodel decoderen via Bayesiaanse inferentie
Dystruct: Dynamically Structured Diffusion Language Model Decoding via Bayesian Inference
May 10, 2026
Auteurs: Bian Sun, Kevin Zhai, Mubarak Shah, Zhenyi Wang
cs.AI
Samenvatting
Diffusietaalmodellen (DLMs) zijn recentelijk naar voren gekomen als een veelbelovend alternatief voor autoregressieve modellen, voornamelijk vanwege hun vermogen om parallel decoderen mogelijk te maken. Ondanks dit voordeel vertrouwen de meeste bestaande DLMs op een vaste generatielengte die voorafgaand aan het decoderen wordt gespecificeerd, wat hun flexibiliteit in praktijktoepassingen beperkt. Hoewel enkele recente werken proberen generatie met variabele lengte te ondersteunen, hebben ze doorgaans aanzienlijke beperkingen: sommige vereisen kostbare hertraining om outputs van variabele lengte mogelijk te maken, terwijl andere uitsluitend vertrouwen op lokale vertrouwenssignalen tijdens het decoderen. Dergelijke lokale criteria slagen er niet in de evoluerende structuur van de sequentie vast te leggen, wat vaak leidt tot suboptimale generatiekwaliteit. In dit artikel stellen we een trainingsvrij, Bayesiaans gestructureerd decoderingsframework voor dat generatie met variabele lengte formuleert als een dynamisch structureel inferentieprobleem. Onze benadering formuleert generatie met variabele lengte als een dynamisch structureel inferentieprobleem, waarbij gezamenlijk de uitbreidingslengte, de blokgrenzen en het decoderingsschema worden berekend. Bij elke stap van vensteruitbreiding integreert de methode lokale onzekerheid met structurele signalen via een uniform mechanisme dat dynamische gestructureerde generatie ondersteunt, inclusief zowel flexibele blokuitbreiding als blokorganisatie, terwijl coherentie behouden blijft. Uitgebreide experimenten op meerdere benchmarks tonen aan dat onze benadering de generatiekwaliteit en flexibiliteit aanzienlijk verbetert in vergelijking met bestaande baselines met vaste en variabele lengte. Deze resultaten benadrukken het voordeel van Bayesiaans gestructureerd decoderen voor diffusietaalmodellen, en bieden een principeel en efficiënt oplossing voor gestructureerde tekstgeneratie.
English
Diffusion language models (DLMs) have recently emerged as a promising alternative to autoregressive models, primarily due to their ability to enable parallel decoding. Despite this advantage, most existing DLMs rely on a fixed generation length specified prior to decoding, which restricts their flexibility in real-world applications. While a few recent works attempt to support flexible-length generation, they typically suffer from notable limitations: some require costly retraining to accommodate variable-length outputs, while others depend solely on local confidence signals during decoding. Such local criteria fail to capture the evolving structure of the sequence, often resulting in suboptimal generation quality. In this paper, we propose a training-free, Bayesian structured decoding framework that formulates flexible-length generation as a dynamic structural inference problem. Our approach formulates flexible-length generation as a dynamic structural inference problem, jointly computing the expansion length, the block boundaries, and the decoding schedule. At each window expansion step, the method integrates local uncertainty with structural signals via a unified mechanism that supports dynamic structured generation, including both flexible block expansion and block organization, while maintaining coherence. Extensive experiments across multiple benchmarks demonstrate that our approach significantly improves generation quality and flexibility over existing fixed-length and flexible-length baselines. These results highlight the advantage of Bayesian structured decoding for diffusion language model, providing a principled and efficient solution for structured text generation.