Discrete diffusie-taalmodellen voor het interactief opstellen van radiologieverslagen
Discrete Diffusion Language Models for Interactive Radiology Report Drafting
July 1, 2026
Auteurs: Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert
cs.AI
Samenvatting
Diffusie-taalmodelen, die tekst genereren door een tokencanvas bidirectioneel te denoizen in plaats van tokens van links naar rechts uit te zenden, zijn concurrerend geworden met autoregressieve (AR) generatie. Medische funderingsmodellen blijven echter bijna geheel autoregressief. Wij passen een mixture-of-experts diffusie-taalmodel, DiffusionGemma-26B, aan en benchmarken het tegen zijn even grote AR-tegenhanger Gemma-4-26B onder een identiek LoRA-recept op medische visuele vraag-antwoorddatasets, gescoord door een robuuste LLM-beoordelaar die ongevoelig is voor woordrijkheid. Diffusie evenaart of overtreft AR op al deze datasets, en het fijngetunede model (3,8B actief) is concurrerend met geavanceerde visie-taalmodelen; de decodering is ook 3,5–4,4 keer sneller. Naast deze gelijkwaardigheid biedt het diffusiemodel een opstelcapaciteit die AR mist: invullen in willekeurige volgorde. Omdat het canvas bidirectioneel wordt gedenoised, kan een radioloog fragmenten van een rapport vastzetten en het model de tekst daartussen laten invullen, een operatie die inherent is aan diffusie maar niet aan autoregressie, die daarin ondermaats presteert. Dit past bij echte rapporten, die vaak kort of inconsistent zijn tussen clinici en instellingen.
English
Diffusion language models, which generate text by denoising a token canvas bidirectionally instead of emitting tokens left to right, have become competitive with autoregressive (AR) generation. Medical foundation models, however, remain almost entirely autoregressive. We adapt a mixture-of-experts diffusion language model, DiffusionGemma-26B, and benchmark it against its same-size AR sibling Gemma-4-26B under an identical LoRA recipe on medical visual question answering datasets, scored by a verbosity-robust LLM judge. Diffusion matches or exceeds AR on all of them, and the finetuned model (3.8B active) is competitive with frontier vision-language models; its decoding is also 3.5-4.4x faster. Beyond this parity, the diffusion model offers a drafting capability AR lacks: any-order infill. Because the canvas is denoised bidirectionally, a radiologist can fix report fragments and have the model fill the text between them, an operation inherent to diffusion but not to autoregression, which is subpar at it. This suits real reports, which are often terse or inconsistent across clinicians and institutions.