CONFLUX: Латентная диффузионная модель для синтеза 3D КТ грудной клетки с пост-обучением с подкреплением (RL)
CONFLUX: A Latent Diusion Model for 3D Chest-CT Synthesis with RL Post-Training
July 3, 2026
Авторы: Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert
cs.AI
Аннотация
Управляемые генеративные модели трехмерных медицинских изображений позволяют синтезировать объемы с заданными клиническими характеристиками, однако для этого требуются образцы, одновременно обладающие высокой точностью, нативной трехмерной структурой и строгим соответствием заданным условиям. Мы представляем CONFLUX — скрытую диффузионную модель для компьютерной томографии (КТ) грудной клетки: трехмерный вариационный автоэнкодер сжимает каждый объем, а трансформатор с выпрямленным потоком (rectified-flow transformer) генерирует данные в скрытом пространстве. Генерация обусловлена структурированными радиологическими метаданными (18 патологических находок, пол, возраст и ядро реконструкции) через адаптивную слоевую нормализацию. Модель превосходит сильные объемные базовые подходы по трипланарному расстоянию Фреше (FID 32,3 против 74,6 у MAISI), обеспечивая при этом прямой контроль над клиническими атрибутами. Для усиления этого контроля мы добавляем этап последующего обучения с подкреплением в режиме онлайн (оптимизация политики относительно группы, GRPO), который поощряет надежность восстановления классификатором запрошенных находок из каждого сгенерированного объема. Согласно оценке отдельного независимого классификатора, последующее обучение устраняет 47% отставания от уровня надежности реальных сканов. Мы публикуем модель и синтетический набор данных КТ грудной клетки объемом около 200 тыс. образцов с метаданными условий, охватывающими широкий спектр клинических находок.
English
Controllable generative models of 3D medical images can synthesize volumes with specified clinical attributes, but this demands samples that are simultaneously high-fidelity, natively 3D, and faithful to the requested conditioning. We present CONFLUX, a latent diffusion model for chest computed tomography (CT): a 3D variational autoencoder compresses each volume, and a rectified-flow transformer generates in the latent space. Generation is conditioned on structured radiological metadata (18 abnormality findings, sex, age, and reconstruction kernel) through adaptive layer normalization. The model leads strong volumetric baselines on tri-planar Frechet distance (FID 32.3 vs. 74.6 for MAISI) while exposing direct control over clinical attributes. To strengthen that control we add an online reinforcement-learning post-training stage (group-relative policy optimization) that rewards how reliably a classifier recovers the requested findings from each generated volume. Judged by a separate, independent classifier, post-training removes 47% of the shortfall relative to real-scan reliability. We release the model and a ~200k synthetic chest-CT dataset with conditioning metadata spanning a wide variety of clinical findings.