ChatPaper.aiChatPaper

Academia de IA em Saúde para Agentes Médicos

Healthcare AI GYM for Medical Agents

May 1, 2026
Autores: Minbyul Jeong
cs.AI

Resumo

O raciocínio clínico exige interações em múltrias etapas — recolha do historial do paciente, solicitação de exames, interpretação de resultados e tomada de decisões de tratamento seguras —, no entanto, um ambiente de treino unificado que forneça a abrangência de domínios clínicos e ferramentas especializadas para formar agentes de IA médica generalizáveis através de aprendizagem por reforço permanece indefinido. Apresentamos um estudo empírico abrangente de RL agentivo multi-turn para IA médica, construído sobre um ambiente compatível com gymnasium que abrange 10 domínios clínicos com mais de 3,6 mil tarefas, 135 ferramentas específicas de domínio e uma base de conhecimento com 828 mil passagens médicas. A nossa análise revela que a estrutura agentiva multi-turn degenera em monólogos verbosos de turno único, caracterizados por uma explosão monótona do comprimento e uma simultânea erosão da frequência de uso de ferramentas. Caracterizamos como este colapso, juntamente com a instabilidade da destilação, decorre do desalinhamento entre recompensas terminais esparsas e trajetórias clínicas sequenciais. Verificamos que o GRPO padrão atinge uma forte precisão final em alguns benchmarks, mas sofre de instabilidade no treino, evidenciada por oscilações significativas no comprimento da resposta e períodos de convergência prolongados. Para melhorar a eficiência e estabilidade do treino, propomos a Destilação On-Policy Truncada por Turno (TT-OPD), uma estrutura de auto-destilação na qual um professor EMA sem gradientes aproveita informações privilegiadas de resultado para fornecer uma regularização KL densa e consciente do resultado em cada turno de conversação. A TT-OPD atinge o melhor desempenho em 10 de 18 benchmarks, com uma melhoria média de +3,9 pp em relação à linha de base não-RL, com convergência precoce mais rápida, comprimento de resposta controlado e uso sustentado de ferramentas multi-turn.
English
Clinical reasoning demands multi-step interactions -- gathering patient history, ordering tests, interpreting results, and making safe treatment decisions -- yet a unified training environment provides the breadth of clinical domains and specialized tools to train generalizable medical AI agents through reinforcement learning remains elusive. We present a comprehensive empirical study of multi-turn agentic RL for medical AI, built on , a gymnasium-compatible environment spanning 10 clinical domains with 3.6K+ tasks, 135 domain-specific tools, and a knowledge base of 828K medical passages. Our analysis reveals that agentic multi-turn structure degrades into verbose single-turn monologues, characterized by monotonic length explosion and a simultaneous erosion of tool-use frequency. We characterize how this collapse, alongside distillation instability, stems from the misalignment of sparse terminal rewards with sequential clinical trajectories. We find that vanilla GRPO achieves strong final accuracy on some benchmarks but suffers from training instability, evidenced by significant oscillations in response length and prolonged convergence periods. To improve training efficiency and stability, we propose Turn-level Truncated On-Policy Distillation (TT-OPD), a self-distillation framework where a gradient-free EMA teacher leverages outcome-privileged information to provide dense, outcome-aware KL regularization at every conversation turn. TT-OPD achieves the best performance on 10 of 18 benchmarks with an average +3.9~pp improvement over the non-RL baseline with faster early convergence, controlled response length, and sustained multi-turn tool use.