TwinTrack : Calibration Multi-Évaluateur a Posteriori pour la Segmentation d'Images Médicales
TwinTrack: Post-hoc Multi-Rater Calibration for Medical Image Segmentation
April 17, 2026
Auteurs: Tristan Kirscher, Alexandra Ertl, Klaus Maier-Hein, Xavier Coubez, Philippe Meyer, Sylvain Faisan
cs.AI
Résumé
La segmentation de l'adénocarcinomacanalaire pancréatique (PDAC) sur scanner avec injection de produit de contraste est intrinsèquement ambiguë : le désaccord entre les évaluateurs experts reflète une incertitude réelle plutôt qu'un bruit d'annotation. Les approches standard d'apprentissage profond supposent l'existence d'une seule vérité terrain, produisant des sorties probabilistes qui peuvent être mal calibrées et difficiles à interpréter face à une telle ambiguïté. Nous présentons TwinTrack, un cadre qui répond à cette lacune par le calibrage a posteriori des probabilités de segmentation d'un ensemble (ensemble) par rapport à la réponse humaine moyenne empirique (MHR) - c'est-à-dire la fraction d'annotateurs experts étiquetant un voxel comme tumeur. Les probabilités calibrées sont ainsi directement interprétables comme la proportion attendue d'annotateurs attribuant le label tumoral, modélisant explicitement le désaccord inter-évaluateurs. La procédure de calibrage a posteriori proposée est simple et ne nécessite qu'un petit ensemble de calibration multi-évaluateurs. Elle améliore constamment les métriques de calibration par rapport aux approches standard lors de l'évaluation sur le benchmark multi-évaluateurs MICCAI 2025 CURVAS-PDACVI.
English
Pancreatic ductal adenocarcinoma (PDAC) segmentation on contrast-enhanced CT is inherently ambiguous: inter-rater disagreement among experts reflects genuine uncertainty rather than annotation noise. Standard deep learning approaches assume a single ground truth, producing probabilistic outputs that can be poorly calibrated and difficult to interpret under such ambiguity. We present TwinTrack, a framework that addresses this gap through post-hoc calibration of ensemble segmentation probabilities to the empirical mean human response (MHR) -the fraction of expert annotators labeling a voxel as tumor. Calibrated probabilities are thus directly interpretable as the expected proportion of annotators assigning the tumor label, explicitly modeling inter-rater disagreement. The proposed post-hoc calibration procedure is simple and requires only a small multi-rater calibration set. It consistently improves calibration metrics over standard approaches when evaluated on the MICCAI 2025 CURVAS-PDACVI multi-rater benchmark.