ChatPaper.aiChatPaper

Dystruct: Decodificação de Modelo de Linguagem de Difusão Dinamicamente Estruturado via Inferência Bayesiana

Dystruct: Dynamically Structured Diffusion Language Model Decoding via Bayesian Inference

May 10, 2026
Autores: Bian Sun, Kevin Zhai, Mubarak Shah, Zhenyi Wang
cs.AI

Resumo

Modelos de linguagem de difusão (DLMs) surgiram recentemente como uma alternativa promissora aos modelos autorregressivos, principalmente devido à sua capacidade de permitir decodificação paralela. Apesar dessa vantagem, a maioria dos DLMs existentes depende de um comprimento de geração fixo, especificado antes da decodificação, o que restringe sua flexibilidade em aplicações do mundo real. Embora alguns trabalhos recentes tentem suportar geração de comprimento flexível, eles geralmente sofrem de limitações notáveis: alguns exigem retreinamento custoso para acomodar saídas de comprimento variável, enquanto outros dependem exclusivamente de sinais de confiança locais durante a decodificação. Tais critérios locais não conseguem capturar a estrutura evolutiva da sequência, resultando frequentemente em qualidade de geração subótima. Neste artigo, propomos uma estrutura de decodificação estruturada bayesiana, sem treinamento, que formula a geração de comprimento flexível como um problema de inferência estrutural dinâmica. Nossa abordagem formula a geração de comprimento flexível como um problema de inferência estrutural dinâmica, calculando conjuntamente o comprimento da expansão, os limites dos blocos e o agendamento da decodificação. A cada passo de expansão da janela, o método integra incerteza local com sinais estruturais por meio de um mecanismo unificado que suporta geração estruturada dinâmica, incluindo tanto expansão flexível de blocos quanto organização de blocos, mantendo a coerência. Experimentos extensivos em múltiplos benchmarks demonstram que nossa abordagem melhora significativamente a qualidade e flexibilidade da geração em relação às linhas de base existentes de comprimento fixo e flexível. Esses resultados destacam a vantagem da decodificação estruturada bayesiana para modelos de linguagem de difusão, fornecendo uma solução fundamentada e eficiente para geração estruturada de texto.
English
Diffusion language models (DLMs) have recently emerged as a promising alternative to autoregressive models, primarily due to their ability to enable parallel decoding. Despite this advantage, most existing DLMs rely on a fixed generation length specified prior to decoding, which restricts their flexibility in real-world applications. While a few recent works attempt to support flexible-length generation, they typically suffer from notable limitations: some require costly retraining to accommodate variable-length outputs, while others depend solely on local confidence signals during decoding. Such local criteria fail to capture the evolving structure of the sequence, often resulting in suboptimal generation quality. In this paper, we propose a training-free, Bayesian structured decoding framework that formulates flexible-length generation as a dynamic structural inference problem. Our approach formulates flexible-length generation as a dynamic structural inference problem, jointly computing the expansion length, the block boundaries, and the decoding schedule. At each window expansion step, the method integrates local uncertainty with structural signals via a unified mechanism that supports dynamic structured generation, including both flexible block expansion and block organization, while maintaining coherence. Extensive experiments across multiple benchmarks demonstrate that our approach significantly improves generation quality and flexibility over existing fixed-length and flexible-length baselines. These results highlight the advantage of Bayesian structured decoding for diffusion language model, providing a principled and efficient solution for structured text generation.