ChatPaper.aiChatPaper

DrugGen 2: Een ziektebewust taalmodel voor het verbeteren van geneesmiddelenontdekking

DrugGen 2: A disease-aware language model for enhancing drug discovery

July 9, 2026
Auteurs: Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami, Navid Mazrouei, Matin Irajpour, Yousof Gheisari, Hajar Sirous
cs.AI

Samenvatting

Huidige computationele benaderingen voor geneesmiddelontwerp richten zich doorgaans op het genereren van moleculen die zijn geconditioneerd op specifieke doelwitten of algemene moleculaire eigenschappen, waarbij vaak de invloed van de ziektecontext op het gedrag van het doelwit en therapeutische uitkomsten wordt genegeerd. Om dit hiaat aan te pakken, introduceren we DrugGen-2, een nieuw generatief model dat kleine moleculen ontwerpt die zijn geconditioneerd op zowel ziekte-ontologie als doelwiteiwitsequenties. DrugGen-2 is ontwikkeld door een voorgetraind GPT-2-model te finetunen op een samengestelde dataset van goedgekeurde geneesmiddelen die zijn gekoppeld aan hun ziekten en doelwitten, met behulp van een tweestapsstrategie bestaande uit gesuperviseerd finetunen gevolgd door versterkend leren via groepsrelatieve beleidsoptimalisatie (GRPO). Dit proces werd gestuurd door beloningsfuncties die optimaliseren voor chemische geldigheid, nieuwheid, diversiteit en een hoge voorspelde bindingsaffiniteit. Bij evaluatie op vijf eiwitdoelwitten die relevant zijn voor diabetische nefropathie, presteerde DrugGen-2 aanzienlijk beter dan de basismodellen (DrugGPT en DrugGen). Het vertoonde een superieur vermogen om unieke moleculen te genereren, vertoonde een grotere structurele gelijkenis met goedgekeurde geneesmiddelen en behaalde verbeterde voorspelde bindingsaffiniteiten voor alle doelwitten. Moleculaire dockinganalyses ondersteunden deze bevindingen verder door kandidaatliganden met sterk bindingspotentieel te identificeren, waaronder verbindingen met voorspelde affiniteiten (-9,917, -9,485 en -9,367) die die van referentiegeneesmiddelen zoals enalapril voor angiotensine-converterend enzym (-8,283) overtroffen. Door ziektespecifieke context te integreren in moleculaire generatie, bevordert DrugGen-2 AI-ondersteunde geneesmiddelenontdekking en biedt het een krachtig hulpmiddel voor de novo-ontwerp en geneesmiddelherbestemming dat rekening houdt met de complexe wisselwerking tussen ziekten en moleculaire doelwitten.
English
Current computational approaches for drug design typically focus on generating molecules conditioned on specific targets or general molecular properties, often neglecting the influence of disease context on target behavior and therapeutic outcomes. To address this gap, we introduce DrugGen-2, a novel generative model that designs small molecules conditioned on both disease ontology and target protein sequences. DrugGen-2 was developed by fine-tuning a pre-trained GPT-2 model on a curated dataset of approved drugs linked to their diseases and targets, using a two-step strategy of supervised fine-tuning followed by reinforcement learning via group relative policy optimization (GRPO). This process was guided by reward functions optimizing for chemical validity, novelty, diversity, and high predicted binding affinity. When evaluated on five protein targets relevant to diabetic nephropathy, DrugGen-2 significantly outperformed baseline models (DrugGPT and DrugGen). It demonstrated a superior capacity to generate unique molecules, exhibited greater structural similarity to approved drugs, and achieved improved predicted binding affinities across all targets. Molecular docking analyses further supported these findings, identifying candidate ligands with strong binding potential, including compounds with predicted affinities (-9.917, -9.485, and -9.367) exceeding those of reference drugs such as enalapril for angiotensin-converting enzyme (-8.283). By integrating disease-specific context into molecular generation, DrugGen-2 advances AI-assisted drug discovery, offering a powerful tool for de novo design and drug repurposing that accounts for the complex interplay between diseases and molecular targets.