ChatPaper.aiChatPaper

Auf dem Weg zur autonomen und auditierbaren Entwicklung medizinischer Bildgebungsmodelle

Towards Autonomous and Auditable Medical Imaging Model Development

July 12, 2026
Autoren: Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao Pan, Hongtao Wu, Houwen Peng, Yu Gu, Lichao Sun, Yixuan Yuan
cs.AI

Zusammenfassung

Large-Language-Modell-Agenten beginnen damit, das Machine-Learning-Engineering (MLE) zu automatisieren, indem sie Planung, Codeausführung, Fehlerbehebung und empirisches Feedback koppeln. Die Übertragung dieser Fähigkeit auf die medizinische Bildgebung bleibt schwierig, da jede Aufgabe modalitätsspezifische Experimente sowie strenge Anforderungen an Validierungsprotokolle und Vorhersageartefakte stellt. Hier stellen wir AMID vor, ein autonomes Multi-Agenten-Framework für die Entwicklung medizinischer Bildgebungsmodelle. AMID schlägt zunächst eine datenabhängige Methodenplanung (Data-Conditioned Method Planning) vor, die grobe aufgabenbezogene Suchräume in ausführbare, parallelisierbare Methodenpfade verfeinert, die auf aufgabenspezifischer Datenanalyse und ausführbaren medizinischen Bildgebungsressourcen basieren. Anschließend entwickelt es eine verifikationsgeführte zweistufige Optimierung (Verification-Guided Two-Stage Optimization), die von einer breiten frühen Exploration verschiedener Methodenpfade zu einer selektiven Nutzung vielversprechender Kandidaten übergeht, während während der gesamten Optimierung eine strenge Verifikation der Validierungsprotokolle, Metrikberechnung und Vorhersageartefakte durchgesetzt wird. Bei 20 medizinischen Bildgebungs-Challenge-Aufgaben, die verschiedene Modalitäten und Vorhersagetypen umfassen, übertraf AMID die evaluierten universellen MLE-Systeme und näherte sich bei mehreren Aufgaben starken menschlich entworfenen Challenge-Lösungen an oder erreichte sie. Diese Ergebnisse deuten darauf hin, dass AMID die aufgabenspezifische Entwicklung von Modellen für die medizinische Bildgebung von einer maßgeschneiderten manuellen Entwicklung in einen agentischen Workflow verwandeln kann, der leistungsstarke und prüfbare Modellartefakte für heterogene Aufgaben produziert.
English
Large language model (LLM) agents are beginning to automate machine learning engineering (MLE) by coupling planning, code execution, debugging, and empirical feedback. Translating this capability to medical imaging remains difficult because each task imposes modality-specific experimentation and strict requirements for validation protocols and prediction artifacts. Here we introduce AMID, an autonomous multi-agent framework for medical imaging model development. AMID first proposes Data-Conditioned Method Planning, which refines coarse task-level search spaces into executable, parallelizable method lanes grounded in task-specific data analysis and runnable medical-imaging resources. It then develops Verification-Guided Two-Stage Optimization, moving from broad early exploration of diverse method lanes to selective exploitation of promising candidates while enforcing strict verification of validation protocols, metric computation, and prediction artifacts throughout the optimization. Across 20 medical imaging challenge tasks spanning diverse modalities and prediction types, AMID outperformed evaluated general-purpose MLE systems and, on several tasks, approached or matched strong human-designed challenge solutions. These results suggest that AMID can turn task-specific medical imaging model development from bespoke manual engineering into an agentic workflow for producing high-performing and auditable model artifacts across heterogeneous tasks.