ChatPaper.aiChatPaper

DrugGen 2: Um modelo de linguagem ciente de doenças para aprimorar a descoberta de fármacos

DrugGen 2: A disease-aware language model for enhancing drug discovery

July 9, 2026
Autores: Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami, Navid Mazrouei, Matin Irajpour, Yousof Gheisari, Hajar Sirous
cs.AI

Resumo

As abordagens computacionais atuais para o design de fármacos geralmente focam na geração de moléculas condicionadas a alvos específicos ou propriedades moleculares gerais, negligenciando frequentemente a influência do contexto da doença no comportamento do alvo e nos resultados terapêuticos. Para preencher essa lacuna, apresentamos o DrugGen-2, um novo modelo generativo que projeta pequenas moléculas condicionadas tanto à ontologia de doenças quanto às sequências de proteínas alvo. O DrugGen-2 foi desenvolvido por meio do ajuste fino de um modelo GPT-2 pré-treinado em um conjunto curado de dados de fármacos aprovados, vinculados às suas doenças e alvos, utilizando uma estratégia de duas etapas: ajuste fino supervisionado seguido de aprendizado por reforço via otimização de política relativa em grupo (GRPO). Esse processo foi guiado por funções de recompensa que otimizam validade química, novidade, diversidade e alta afinidade de ligação prevista. Quando avaliado em cinco proteínas alvo relevantes para nefropatia diabética, o DrugGen-2 superou significativamente os modelos de base (DrugGPT e DrugGen). Ele demonstrou capacidade superior de gerar moléculas únicas, apresentou maior similaridade estrutural com fármacos aprovados e alcançou afinidades de ligação previstas melhores em todos os alvos. Análises de docking molecular corroboraram esses achados, identificando ligantes candidatos com forte potencial de ligação, incluindo compostos com afinidades previstas (-9,917, -9,485 e -9,367) superiores às de fármacos de referência, como o enalapril para a enzima conversora de angiotensina (-8,283). Ao integrar o contexto específico da doença na geração molecular, o DrugGen-2 avança na descoberta de fármacos assistida por inteligência artificial, oferecendo uma ferramenta poderosa para design de novo e reposicionamento de fármacos que leva em conta a complexa interação entre doenças e alvos moleculares.
English
Current computational approaches for drug design typically focus on generating molecules conditioned on specific targets or general molecular properties, often neglecting the influence of disease context on target behavior and therapeutic outcomes. To address this gap, we introduce DrugGen-2, a novel generative model that designs small molecules conditioned on both disease ontology and target protein sequences. DrugGen-2 was developed by fine-tuning a pre-trained GPT-2 model on a curated dataset of approved drugs linked to their diseases and targets, using a two-step strategy of supervised fine-tuning followed by reinforcement learning via group relative policy optimization (GRPO). This process was guided by reward functions optimizing for chemical validity, novelty, diversity, and high predicted binding affinity. When evaluated on five protein targets relevant to diabetic nephropathy, DrugGen-2 significantly outperformed baseline models (DrugGPT and DrugGen). It demonstrated a superior capacity to generate unique molecules, exhibited greater structural similarity to approved drugs, and achieved improved predicted binding affinities across all targets. Molecular docking analyses further supported these findings, identifying candidate ligands with strong binding potential, including compounds with predicted affinities (-9.917, -9.485, and -9.367) exceeding those of reference drugs such as enalapril for angiotensin-converting enzyme (-8.283). By integrating disease-specific context into molecular generation, DrugGen-2 advances AI-assisted drug discovery, offering a powerful tool for de novo design and drug repurposing that accounts for the complex interplay between diseases and molecular targets.