ChatPaper.aiChatPaper

S2D2: Snelle Decodering voor Diffusie-LLM's via Trainingsvrije Zelf-Speculatie

S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation

March 26, 2026
Auteurs: Ligong Han, Hao Wang, Han Gao, Kai Xu, Akash Srivastava
cs.AI

Samenvatting

Blokdiffusie-taalmodellen bieden een veelbelovende weg naar snellere-dan-autoregressieve generatie door bloksgewijs autoregressieve decodering te combineren met parallelle denoisering binnen blokken. In het weinig-stappen regime dat nodig is voor praktische versnelling, is standaard op vertrouwensdrempel gebaseerde decodering echter vaak broos: agressieve drempels schaden de kwaliteit, terwijl conservatieve drempels onnodige denoiseringsstappen vereisen. Bestaande benaderingen die dit probleem aanpakken, vereisen óf extra training óf veroorzaken extra rekenkosten tijdens het testen. Wij presenteren S2D2, een trainingsvrij zelf-speculatief decoderingskader voor blokdiffusie-taalmodellen. Onze belangrijkste observatie is dat een blokdiffusiemodel autoregressief wordt wanneer de blokgrootte wordt teruggebracht tot één, waardoor hetzelfde voorgetrainde model kan fungeren als zowel opsteller als verifier. S2D2 voegt een speculatieve verificatiestap in de standaard blokdiffusie-decodering in en gebruikt lichtgewicht routeringsbeleid om te beslissen wanneer verificatie zijn kost waard is. Dit resulteert in een hybride decoderingspad waarbij diffusie tokens parallel voorstelt, terwijl de autoregressieve modus fungeert als een lokale sequentie-niveau criticus. Over drie mainstream blokdiffusiefamilies heen verbetert S2D2 consistent de nauwkeurigheid-snelheid afweging ten opzichte van sterke baseline-methoden met vertrouwensdrempels. Op SDAR observeren we een versnelling tot 4,7 keer ten opzichte van autoregressieve decodering, en tot 1,57 keer ten opzichte van een afgestemde dynamische decoderings-baseline, terwijl de nauwkeurigheid met tot 4,5 punten verbetert. Op LLaDA2.1-Mini blijft S2D2 complementair aan ingebouwde zelfcorrectie, inclusief een conservatieve instelling waar het 4,4 keer sneller is dan de statische baseline met lichtelijk hogere nauwkeurigheid.
English
Block-diffusion language models offer a promising path toward faster-than-autoregressive generation by combining block-wise autoregressive decoding with within-block parallel denoising. However, in the few-step regime needed for practical acceleration, standard confidence-thresholded decoding is often brittle: aggressive thresholds hurt quality, while conservative thresholds require unnecessary denoising steps. Existing approaches that address this issue either require additional training or incur extra test-time compute. We present S2D2, a training-free self-speculative decoding framework for block-diffusion language models. Our key observation is that a block-diffusion model becomes autoregressive when the block size is reduced to one, allowing the same pretrained model to act as both drafter and verifier. S2D2 inserts a speculative verification step into standard block-diffusion decoding and uses lightweight routing policies to decide when verification is worth its cost. This yields a hybrid decoding trajectory in which diffusion proposes tokens in parallel, while the autoregressive mode acts as a local sequence-level critic. Across three mainstream block-diffusion families, S2D2 consistently improves the accuracy-speed tradeoff over strong confidence-thresholding baselines. On SDAR, we observe up to 4.7times speedup over autoregressive decoding, and up to 1.57times over a tuned dynamic decoding baseline while improving accuracy by up to 4.5 points. On LLaDA2.1-Mini, S2D2 remains complementary to built-in self-correction, including a conservative setting where it is 4.4times faster than the static baseline with slightly higher accuracy.