MedSkillAudit: Uma Estrutura de Auditoria Específica de Domínio para Habilidades de Agentes de Pesquisa Médica
MedSkillAudit: A Domain-Specific Audit Framework for Medical Research Agent Skills
April 22, 2026
Autores: Yingyong Hou, Xinyuan Lao, Huimei Wang, Qianyu Yao, Wei Chen, Bocheng Huang, Fei Sun, Yuxian Lv, Weiqi Lei, Xueqian Wen, Pengfei Xia, Zhujun Tan, Shengyang Xie
cs.AI
Resumo
**Contexto:** As competências de agentes estão cada vez mais sendo implantadas como unidades modulares e reutilizáveis de capacidade em sistemas de agentes de IA. As competências de agentes de pesquisa médica exigem salvaguardas além da avaliação de propósito geral, incluindo integridade científica, validade metodológica, reprodutibilidade e segurança de limites. Este estudo desenvolveu e avaliou preliminarmente uma estrutura de auditoria específica do domínio para competências de agentes de pesquisa médica, com foco na confiabilidade em comparação com a revisão por especialistas. **Métodos:** Desenvolvemos o MedSkillAudit (skill-auditor@1.0), uma estrutura em camadas que avalia a prontidão para liberação de competências antes da implantação. Avaliamos 75 competências em cinco categorias de pesquisa médica (15 por categoria). Dois especialistas atribuíram independentemente uma pontuação de qualidade (0-100), uma disposição ordinal de liberação (Pronto para Produção / Liberação Limitada / Apenas Beta / Rejeitar) e um sinalizador de falha de alto risco. A concordância sistema-especialista foi quantificada usando ICC(2,1) e kappa de Cohen ponderado linearmente, comparada com a linha de base de concordância interavaliadores humana. **Resultados:** A pontuação média de qualidade por consenso foi de 72,4 (DP = 13,0); 57,3% das competências ficaram abaixo do limiar de Liberação Limitada. O MedSkillAudit alcançou ICC(2,1) = 0,449 (IC 95%: 0,250-0,610), excedendo o ICC interavaliadores humano de 0,300. A divergência sistema-consenso (DP = 9,5) foi menor do que a divergência inter-especialistas (DP = 12,4), sem viés direcional (Wilcoxon p = 0,613). O Design de Protocolo apresentou a concordância mais forte a nível de categoria (ICC = 0,551); a Redação Acadêmica apresentou um ICC negativo (-0,567), refletindo um desajuste estrutural entre a rubrica e os especialistas. **Conclusões:** A auditoria específica do domínio antes da implantação pode fornecer uma base prática para governar as competências de agentes de pesquisa médica, complementando as verificações de qualidade de propósito geral com fluxos de trabalho de auditoria estruturados adaptados aos casos de uso científicos.
English
Background: Agent skills are increasingly deployed as modular, reusable capability units in AI agent systems. Medical research agent skills require safeguards beyond general-purpose evaluation, including scientific integrity, methodological validity, reproducibility, and boundary safety. This study developed and preliminarily evaluated a domain-specific audit framework for medical research agent skills, with a focus on reliability against expert review. Methods: We developed MedSkillAudit (skill-auditor@1.0), a layered framework assessing skill release readiness before deployment. We evaluated 75 skills across five medical research categories (15 per category). Two experts independently assigned a quality score (0-100), an ordinal release disposition (Production Ready / Limited Release / Beta Only / Reject), and a high-risk failure flag. System-expert agreement was quantified using ICC(2,1) and linearly weighted Cohen's kappa, benchmarked against the human inter-rater baseline. Results: The mean consensus quality score was 72.4 (SD = 13.0); 57.3% of skills fell below the Limited Release threshold. MedSkillAudit achieved ICC(2,1) = 0.449 (95% CI: 0.250-0.610), exceeding the human inter-rater ICC of 0.300. System-consensus score divergence (SD = 9.5) was smaller than inter-expert divergence (SD = 12.4), with no directional bias (Wilcoxon p = 0.613). Protocol Design showed the strongest category-level agreement (ICC = 0.551); Academic Writing showed a negative ICC (-0.567), reflecting a structural rubric-expert mismatch. Conclusions: Domain-specific pre-deployment audit may provide a practical foundation for governing medical research agent skills, complementing general-purpose quality checks with structured audit workflows tailored to scientific use cases.