ChatPaper.aiChatPaper

Modelos de Linguagem de Difusão Discreta para Elaboração Interativa de Relatórios Radiológicos

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

July 1, 2026
Autores: Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert
cs.AI

Resumo

Modelos de linguagem de difusão, que geram texto ao realizar denoising bidirecional de um canvas de tokens, em vez de emitir tokens da esquerda para a direita, tornaram-se competitivos com a geração autoregressiva (AR). No entanto, os modelos de base médicos permanecem quase inteiramente autoregressivos. Adaptamos um modelo de linguagem de difusão com mistura de especialistas, DiffusionGemma-26B, e o avaliamos em comparação com seu equivalente AR de mesmo tamanho, Gemma-4-26B, sob uma receita LoRA idêntica em conjuntos de dados de resposta a perguntas visuais médicas, pontuados por um juiz LLM robusto à verbosidade. A difusão iguala ou supera a AR em todos eles, e o modelo ajustado (3,8B ativos) é competitivo com modelos de linguagem visual de fronteira; sua decodificação também é 3,5–4,4 vezes mais rápida. Além dessa paridade, o modelo de difusão oferece uma capacidade de rascunho que a AR não possui: preenchimento em qualquer ordem. Como o canvas tem o ruído removido bidirecionalmente, um radiologista pode fixar fragmentos de relatório e fazer com que o modelo preencha o texto entre eles, uma operação inerente à difusão, mas não à autoregressão, que é inferior nessa tarefa. Isso se adequa a relatórios reais, que são frequentemente concisos ou inconsistentes entre clínicos e instituições.
English
Diffusion language models, which generate text by denoising a token canvas bidirectionally instead of emitting tokens left to right, have become competitive with autoregressive (AR) generation. Medical foundation models, however, remain almost entirely autoregressive. We adapt a mixture-of-experts diffusion language model, DiffusionGemma-26B, and benchmark it against its same-size AR sibling Gemma-4-26B under an identical LoRA recipe on medical visual question answering datasets, scored by a verbosity-robust LLM judge. Diffusion matches or exceeds AR on all of them, and the finetuned model (3.8B active) is competitive with frontier vision-language models; its decoding is also 3.5-4.4x faster. Beyond this parity, the diffusion model offers a drafting capability AR lacks: any-order infill. Because the canvas is denoised bidirectionally, a radiologist can fix report fragments and have the model fill the text between them, an operation inherent to diffusion but not to autoregression, which is subpar at it. This suits real reports, which are often terse or inconsistent across clinicians and institutions.