ChatPaper.aiChatPaper

Naar autonome en auditeerbare modelontwikkeling voor medische beeldvorming

Towards Autonomous and Auditable Medical Imaging Model Development

July 12, 2026
Auteurs: Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao Pan, Hongtao Wu, Houwen Peng, Yu Gu, Lichao Sun, Yixuan Yuan
cs.AI

Samenvatting

Grote taalmodellen (LLM) agenten beginnen machine learning engineering (MLE) te automatiseren door planning, code-uitvoering, debuggen en empirische feedback te koppelen. Het vertalen van deze mogelijkheid naar medische beeldvorming blijft moeilijk omdat elke taak modus-specifieke experimenten en strikte vereisten voor validatieprotocollen en voorspellingsartefacten oplegt. Hier introduceren we AMID, een autonoom multi-agentframework voor de ontwikkeling van medische beeldvormingsmodellen. AMID stelt eerst Data-Gestuurde Methodeplanning voor, die grove taakniveau-zoekruimten verfijnt tot uitvoerbare, paralleliseerbare methodebanen die zijn gebaseerd op taakspecifieke data-analyse en uitvoerbare medische beeldvormingsbronnen. Vervolgens ontwikkelt het Verificatie-Gestuurde Tweetrapsoptimalisatie, die overgaat van brede vroege verkenning van diverse methodebanen naar selectieve exploitatie van veelbelovende kandidaten, terwijl gedurende de optimalisatie strenge verificatie van validatieprotocollen, metriekberekening en voorspellingsartefacten wordt afgedwongen. In 20 medische beeldvormingsuitdagingstaken, die uiteenlopende modaliteiten en voorspellingstypes omvatten, presteerde AMID beter dan geëvalueerde algemene MLE-systemen en benaderde of evenaarde het bij verschillende taken sterke, door mensen ontworpen uitdagingsoplossingen. Deze resultaten suggereren dat AMID taakspecifieke ontwikkeling van medische beeldvormingsmodellen kan omzetten van op maat gemaakte handmatige engineering naar een agentische workflow voor het produceren van hoogwaardige en controleerbare modelartefacten voor heterogene taken.
English
Large language model (LLM) agents are beginning to automate machine learning engineering (MLE) by coupling planning, code execution, debugging, and empirical feedback. Translating this capability to medical imaging remains difficult because each task imposes modality-specific experimentation and strict requirements for validation protocols and prediction artifacts. Here we introduce AMID, an autonomous multi-agent framework for medical imaging model development. AMID first proposes Data-Conditioned Method Planning, which refines coarse task-level search spaces into executable, parallelizable method lanes grounded in task-specific data analysis and runnable medical-imaging resources. It then develops Verification-Guided Two-Stage Optimization, moving from broad early exploration of diverse method lanes to selective exploitation of promising candidates while enforcing strict verification of validation protocols, metric computation, and prediction artifacts throughout the optimization. Across 20 medical imaging challenge tasks spanning diverse modalities and prediction types, AMID outperformed evaluated general-purpose MLE systems and, on several tasks, approached or matched strong human-designed challenge solutions. These results suggest that AMID can turn task-specific medical imaging model development from bespoke manual engineering into an agentic workflow for producing high-performing and auditable model artifacts across heterogeneous tasks.