ChatPaper.aiChatPaper

CONFLUX: Un modelo de difusión latente para la síntesis de TC de tórax 3D con post-entrenamiento mediante aprendizaje por refuerzo

CONFLUX: A Latent Diusion Model for 3D Chest-CT Synthesis with RL Post-Training

July 3, 2026
Autores: Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert
cs.AI

Resumen

Los modelos generativos controlables de imágenes médicas 3D pueden sintetizar volúmenes con atributos clínicos específicos, pero esto requiere muestras que sean simultáneamente de alta fidelidad, nativamente tridimensionales y fieles a la condición solicitada. Presentamos CONFLUX, un modelo de difusión latente para tomografía computarizada (TC) de tórax: un autoencoder variacional 3D comprime cada volumen, y un transformador de flujo rectificado genera en el espacio latente. La generación se condiciona a metadatos radiológicos estructurados (18 hallazgos anormales, sexo, edad y kernel de reconstrucción) mediante normalización adaptativa de capas. El modelo supera a sólidas líneas base volumétricas en la distancia de Fréchet triplanar (FID 32,3 frente a 74,6 para MAISI) al mismo tiempo que expone un control directo sobre los atributos clínicos. Para fortalecer dicho control, añadimos una etapa de post-entrenamiento mediante aprendizaje por refuerzo en línea (optimización de políticas relativa al grupo) que recompensa la fiabilidad con la que un clasificador recupera los hallazgos solicitados a partir de cada volumen generado. Evaluado por un clasificador independiente y separado, el post-entrenamiento elimina el 47% del déficit en relación con la fiabilidad de las exploraciones reales. Publicamos el modelo y un conjunto de datos sintéticos de TC de tórax de aproximadamente 200k muestras con metadatos de condicionamiento que abarcan una amplia variedad de hallazgos clínicos.
English
Controllable generative models of 3D medical images can synthesize volumes with specified clinical attributes, but this demands samples that are simultaneously high-fidelity, natively 3D, and faithful to the requested conditioning. We present CONFLUX, a latent diffusion model for chest computed tomography (CT): a 3D variational autoencoder compresses each volume, and a rectified-flow transformer generates in the latent space. Generation is conditioned on structured radiological metadata (18 abnormality findings, sex, age, and reconstruction kernel) through adaptive layer normalization. The model leads strong volumetric baselines on tri-planar Frechet distance (FID 32.3 vs. 74.6 for MAISI) while exposing direct control over clinical attributes. To strengthen that control we add an online reinforcement-learning post-training stage (group-relative policy optimization) that rewards how reliably a classifier recovers the requested findings from each generated volume. Judged by a separate, independent classifier, post-training removes 47% of the shortfall relative to real-scan reliability. We release the model and a ~200k synthetic chest-CT dataset with conditioning metadata spanning a wide variety of clinical findings.