ChatPaper.aiChatPaper

CONFLUX : Un modèle de diffusion latent pour la synthèse de CT thoracique 3D avec post-entraînement par RL

CONFLUX: A Latent Diusion Model for 3D Chest-CT Synthesis with RL Post-Training

July 3, 2026
Auteurs: Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert
cs.AI

Résumé

Les modèles génératifs contrôlables d'images médicales 3D peuvent synthétiser des volumes dotés d'attributs cliniques spécifiques, mais cela nécessite des échantillons à la fois haute-fidélité, nativement 3D et fidèles aux conditions demandées. Nous présentons CONFLUX, un modèle de diffusion latent pour la tomodensitométrie (TDM) thoracique : un autoencodeur variationnel 3D comprime chaque volume, et un transformateur à flux redressé génère dans l'espace latent. La génération est conditionnée sur des métadonnées radiologiques structurées (18 anomalies, sexe, âge et noyau de reconstruction) via une normalisation adaptative de couche. Le modèle surpasse les références volumétriques solides en termes de distance de Fréchet triplanaire (FID 32,3 contre 74,6 pour MAISI) tout en offrant un contrôle direct sur les attributs cliniques. Pour renforcer ce contrôle, nous ajoutons une étape de post-entraînement par apprentissage par renforcement en ligne (optimisation de politique relative au groupe) qui récompense la fiabilité avec laquelle un classifieur retrouve les anomalies demandées dans chaque volume généré. Selon un classifieur distinct et indépendant, le post-entraînement élimine 47 % du déficit par rapport à la fiabilité des vrais scans. Nous publions le modèle et un ensemble de données synthétiques de TDM thoracique d'environ 200 000 échantillons avec des métadonnées de conditionnement couvrant une grande variété de constats cliniques.
English
Controllable generative models of 3D medical images can synthesize volumes with specified clinical attributes, but this demands samples that are simultaneously high-fidelity, natively 3D, and faithful to the requested conditioning. We present CONFLUX, a latent diffusion model for chest computed tomography (CT): a 3D variational autoencoder compresses each volume, and a rectified-flow transformer generates in the latent space. Generation is conditioned on structured radiological metadata (18 abnormality findings, sex, age, and reconstruction kernel) through adaptive layer normalization. The model leads strong volumetric baselines on tri-planar Frechet distance (FID 32.3 vs. 74.6 for MAISI) while exposing direct control over clinical attributes. To strengthen that control we add an online reinforcement-learning post-training stage (group-relative policy optimization) that rewards how reliably a classifier recovers the requested findings from each generated volume. Judged by a separate, independent classifier, post-training removes 47% of the shortfall relative to real-scan reliability. We release the model and a ~200k synthetic chest-CT dataset with conditioning metadata spanning a wide variety of clinical findings.