Hacia el desarrollo autónomo y auditable de modelos de imágenes médicas
Towards Autonomous and Auditable Medical Imaging Model Development
July 12, 2026
Autores: Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao Pan, Hongtao Wu, Houwen Peng, Yu Gu, Lichao Sun, Yixuan Yuan
cs.AI
Resumen
Los agentes de modelos de lenguaje de gran escala (LLM) están comenzando a automatizar la ingeniería de aprendizaje automático (MLE) mediante la combinación de planificación, ejecución de código, depuración y retroalimentación empírica. Trasladar esta capacidad al ámbito de la imagen médica sigue siendo difícil, ya que cada tarea impone una experimentación específica según la modalidad, así como requisitos estrictos en cuanto a protocolos de validación y artefactos de predicción. Aquí presentamos AMID, un marco multiagente autónomo para el desarrollo de modelos de imagen médica. AMID propone primero la Planificación de Métodos Condicionada por Datos, que refina espacios de búsqueda generales a nivel de tarea en carriles de método ejecutables y paralelizables, fundamentados en un análisis de datos específico de la tarea y en recursos ejecutables de imagen médica. A continuación, desarrolla la Optimización en Dos Etapas Guiada por Verificación, que pasa de una exploración amplia temprana de diversos carriles de método a una explotación selectiva de los candidatos prometedores, imponiendo una verificación estricta de los protocolos de validación, el cálculo de métricas y los artefactos de predicción durante toda la optimización. En 20 tareas de desafío de imagen médica que abarcan diversas modalidades y tipos de predicción, AMID superó a los sistemas de MLE de propósito general evaluados y, en varias tareas, se aproximó o igualó a las soluciones de desafío diseñadas por humanos. Estos resultados sugieren que AMID puede transformar el desarrollo de modelos de imagen médica específicos de cada tarea, pasando de una ingeniería manual hecha a medida a un flujo de trabajo agéntico para producir artefactos de modelo de alto rendimiento y auditables en tareas heterogéneas.
English
Large language model (LLM) agents are beginning to automate machine learning engineering (MLE) by coupling planning, code execution, debugging, and empirical feedback. Translating this capability to medical imaging remains difficult because each task imposes modality-specific experimentation and strict requirements for validation protocols and prediction artifacts. Here we introduce AMID, an autonomous multi-agent framework for medical imaging model development. AMID first proposes Data-Conditioned Method Planning, which refines coarse task-level search spaces into executable, parallelizable method lanes grounded in task-specific data analysis and runnable medical-imaging resources. It then develops Verification-Guided Two-Stage Optimization, moving from broad early exploration of diverse method lanes to selective exploitation of promising candidates while enforcing strict verification of validation protocols, metric computation, and prediction artifacts throughout the optimization. Across 20 medical imaging challenge tasks spanning diverse modalities and prediction types, AMID outperformed evaluated general-purpose MLE systems and, on several tasks, approached or matched strong human-designed challenge solutions. These results suggest that AMID can turn task-specific medical imaging model development from bespoke manual engineering into an agentic workflow for producing high-performing and auditable model artifacts across heterogeneous tasks.