CONFLUX: Um Modelo de Difusão Latente para Síntese de CT Torácico 3D com Pós-Treinamento com RL
CONFLUX: A Latent Diusion Model for 3D Chest-CT Synthesis with RL Post-Training
July 3, 2026
Autores: Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert
cs.AI
Resumo
Modelos generativos controláveis de imagens médicas 3D podem sintetizar volumes com atributos clínicos especificados, mas isso exige amostras que sejam simultaneamente de alta fidelidade, nativamente 3D e fiéis à condição solicitada. Apresentamos o CONFLUX, um modelo de difusão latente para tomografia computadorizada (TC) de tórax: um autoencoder variacional 3D comprime cada volume, e um transformador de fluxo retificado gera no espaço latente. A geração é condicionada a metadados radiológicos estruturados (18 achados de anormalidade, sexo, idade e kernel de reconstrução) por meio de normalização adaptativa de camadas. O modelo supera fortes linhas de base volumétricas na distância de Fréchet triplanar (FID 32,3 vs. 74,6 para o MAISI), ao mesmo tempo que expõe controle direto sobre atributos clínicos. Para fortalecer esse controle, adicionamos uma etapa de pós-treinamento por aprendizado por reforço online (otimização de política relativa ao grupo) que recompensa quão confiavelmente um classificador recupera os achados solicitados a partir de cada volume gerado. Avaliado por um classificador separado e independente, o pós-treinamento remove 47% do déficit em relação à confiabilidade de exames reais. Disponibilizamos o modelo e um conjunto de dados sintéticos de TC de tórax com aproximadamente 200 mil volumes, acompanhados de metadados de condicionamento que abrangem uma ampla variedade de achados clínicos.
English
Controllable generative models of 3D medical images can synthesize volumes with specified clinical attributes, but this demands samples that are simultaneously high-fidelity, natively 3D, and faithful to the requested conditioning. We present CONFLUX, a latent diffusion model for chest computed tomography (CT): a 3D variational autoencoder compresses each volume, and a rectified-flow transformer generates in the latent space. Generation is conditioned on structured radiological metadata (18 abnormality findings, sex, age, and reconstruction kernel) through adaptive layer normalization. The model leads strong volumetric baselines on tri-planar Frechet distance (FID 32.3 vs. 74.6 for MAISI) while exposing direct control over clinical attributes. To strengthen that control we add an online reinforcement-learning post-training stage (group-relative policy optimization) that rewards how reliably a classifier recovers the requested findings from each generated volume. Judged by a separate, independent classifier, post-training removes 47% of the shortfall relative to real-scan reliability. We release the model and a ~200k synthetic chest-CT dataset with conditioning metadata spanning a wide variety of clinical findings.