ChatPaper.aiChatPaper

Multi-Block diffusietaalmodellen

Multi-Block Diffusion Language Models

June 30, 2026
Auteurs: Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu, Jiajun Li, Dandan Tu, Xiaohui Yan, Kai Yu, Pengfei Liu, Zhijie Deng
cs.AI

Samenvatting

Blokdiffusie-taalmodellen (BD-TM's) verbeteren diffusie-gebaseerde tekstgeneratie met behulp van KV-caching en flexibele lengtegeneratie. Een logische volgende stap is om ze uit te breiden van Enkelblokdiffusie (EnkelBD) naar Meervoudigeblokdiffusie (MeervoudBD), waarbij een lopende set opeenvolgende blokken gelijktijdig wordt gedecodeerd voor inter-blok parallellisme. Echter, bestaande BD-TM's worden meestal getraind onder teacher forcing, waarbij het model slechts één ruisblok waarneemt, geconditioneerd op een schoon prefix. Hoewel de recente diffusieforcing-strategie zichtbaarheid tussen meerdere ruisblokken introduceert, verschillen de trainingstoestanden nog steeds van MeervoudBD-inferentie, waarbij decodering werkt op een begrensde lopende set met heterogene slot-gewijze ruispatronen. Om deze kloof te overbruggen, stellen we Meervoudigeblokdiffusie-taalmodellen (MBD-TM's) voor, verkregen door BD-TM's na te trainen met Meervoudigeblok Teacher Forcing (MeervoudTF). MeervoudTF integreert teacher forcing en diffusieforcing door te trainen op begrensde ruisgroepen, geconditioneerd op schone prefixes, met gerandomiseerde ruisschema's die beter overeenkomen met MeervoudBD-inferentietoestanden. Om MeervoudBD praktisch uitvoerbaar te maken, introduceren we verder een geoptimaliseerd decoderingsalgoritme gebaseerd op het Blokbuffer-mechanisme dat prefix-cache-hergebruik behoudt, invoervormen statisch houdt en toegenomen decoderingsparallellisme vertaalt naar versnelling in wandkloktijd. Empirisch gezien verhoogt MBD-LLaDA2-Mini het gemiddelde aantal tokens per voorwaartse doorgang (TPF) van 3,47 naar 6,19 en verbetert de gemiddelde nauwkeurigheid van 79,95% naar 81,03%; in combinatie met DMax bereikt MBD-LLaDA2-Mini-DMax een gemiddelde TPF van 9,34 met slechts een daling van 1,02% in nauwkeurigheid op wiskunde- en codebenchmarks.
English
Block Diffusion Language Models (BD-LMs) improve diffusion-based text generation with KV caching and flexible-length generation. A natural next step is to extend them from Single-Block Diffusion (SingleBD) to Multi-Block Diffusion (MultiBD), where a running-set of consecutive blocks is decoded concurrently for inter-block parallelism. However, existing BD-LMs are mostly trained under teacher forcing, where the model observes only one noisy block conditioned on a clean prefix. While the recent diffusion forcing strategy introduces visibility among multiple noisy blocks, its training states still differ from MultiBD inference, where decoding operates on a bounded running-set with heterogeneous slot-wise noise patterns. To bridge this gap, we propose Multi-Block Diffusion Language Models (MBD-LMs), obtained by post-training BD-LMs with Multi-block Teacher Forcing (MultiTF). MultiTF integrates teacher forcing and diffusion forcing by training on bounded noise-groups conditioned on clean prefixes, with randomized noise-schedulers that better match MultiBD inference states. To make MultiBD practically executable, we further introduce an optimized decoding algorithm based on the Block Buffer mechanism that preserves prefix-cache reuse, keeps input shapes static, and translates increased decoding parallelism into wall-clock acceleration. Empirically, MBD-LLaDA2-Mini increases average Tokens Per Forward pass (TPF) from 3.47 to 6.19 and improves average accuracy from 79.95% to 81.03%; when combined with DMax, MBD-LLaDA2-Mini-DMax reaches an average TPF of 9.34 with only a 1.02% accuracy drop on math and code benchmarks.