CONFLUX: Een latent diffusiemodel voor 3D borst-CT-synthese met RL post-training
CONFLUX: A Latent Diusion Model for 3D Chest-CT Synthesis with RL Post-Training
July 3, 2026
Auteurs: Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert
cs.AI
Samenvatting
Beheersbare generatieve modellen van 3D-medische beelden kunnen volumes synthetiseren met gespecificeerde klinische attributen, maar dit vereist samples die tegelijkertijd hoge getrouwheid, native 3D en trouw aan de gevraagde conditionering zijn. Wij presenteren CONFLUX, een latent diffusiemodel voor computertomografie (CT) van de borstkas: een 3D-variatie-autocoder comprimeert elk volume, en een rectified-flow-transformer genereert in de latente ruimte. Generatie wordt geconditioneerd op gestructureerde radiologische metadata (18 afwijkingsbevindingen, geslacht, leeftijd en reconstructiekernel) via adaptieve laagnormalisatie. Het model overtreft sterke volumetrische baselines op tri-planaire Fréchet-afstand (FID 32,3 vs. 74,6 voor MAISI) terwijl het directe controle over klinische attributen biedt. Om die controle te versterken, voegen we een online-reinforcement-learning-post-trainingfase toe (groepsrelatieve beleidsoptimalisatie) die beloont hoe betrouwbaar een classificator de gevraagde bevindingen uit elk gegenereerd volume herstelt. Beoordeeld door een aparte, onafhankelijke classificator, verwijdert de post-training 47% van het tekort ten opzichte van de betrouwbaarheid van echte scans. Wij geven het model en een dataset van ~200k synthetische borstkas-CT’s vrij, met conditionering metadata die een breed scala aan klinische bevindingen omvatten.
English
Controllable generative models of 3D medical images can synthesize volumes with specified clinical attributes, but this demands samples that are simultaneously high-fidelity, natively 3D, and faithful to the requested conditioning. We present CONFLUX, a latent diffusion model for chest computed tomography (CT): a 3D variational autoencoder compresses each volume, and a rectified-flow transformer generates in the latent space. Generation is conditioned on structured radiological metadata (18 abnormality findings, sex, age, and reconstruction kernel) through adaptive layer normalization. The model leads strong volumetric baselines on tri-planar Frechet distance (FID 32.3 vs. 74.6 for MAISI) while exposing direct control over clinical attributes. To strengthen that control we add an online reinforcement-learning post-training stage (group-relative policy optimization) that rewards how reliably a classifier recovers the requested findings from each generated volume. Judged by a separate, independent classifier, post-training removes 47% of the shortfall relative to real-scan reliability. We release the model and a ~200k synthetic chest-CT dataset with conditioning metadata spanning a wide variety of clinical findings.