ChatPaper.aiChatPaper

DrugGen 2: Осведомленная о заболеваниях языковая модель для улучшения открытия лекарств

DrugGen 2: A disease-aware language model for enhancing drug discovery

July 9, 2026
Авторы: Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami, Navid Mazrouei, Matin Irajpour, Yousof Gheisari, Hajar Sirous
cs.AI

Аннотация

Современные вычислительные подходы к дизайну лекарств обычно ориентированы на генерацию молекул, обусловленную конкретными мишенями или общими молекулярными свойствами, зачастую игнорируя влияние контекста заболевания на поведение мишени и терапевтические результаты. Для устранения этого пробела мы представляем DrugGen-2 — новую генеративную модель, которая разрабатывает малые молекулы с учетом как онтологии заболеваний, так и последовательностей белков-мишеней. DrugGen-2 была создана путем точной настройки предварительно обученной модели GPT-2 на курируемом наборе данных одобренных препаратов, связанных с их заболеваниями и мишенями, с использованием двухэтапной стратегии: контролируемой точной настройки с последующим обучением с подкреплением через групповую относительную оптимизацию политики (GRPO). Этот процесс направлялся функциями вознаграждения, оптимизирующими химическую валидность, новизну, разнообразие и высокую прогнозируемую аффинность связывания. При оценке на пяти белковых мишенях, значимых для диабетической нефропатии, DrugGen-2 значительно превзошла базовые модели (DrugGPT и DrugGen). Она продемонстрировала превосходную способность генерировать уникальные молекулы, большее структурное сходство с одобренными препаратами и улучшенные прогнозируемые аффинности связывания по всем мишеням. Докинговый анализ дополнительно подтвердил эти результаты, выявив кандидатные лиганды с высоким потенциалом связывания, включая соединения с прогнозируемой аффинностью (-9,917, -9,485 и -9,367), превышающей таковую для референтных препаратов, таких как эналаприл в отношении ангиотензинпревращающего фермента (-8,283). Интегрируя контекст, специфичный для заболевания, в генерацию молекул, DrugGen-2 продвигает AI-ассистированное открытие лекарств, предлагая мощный инструмент для de novo дизайна и перепрофилирования препаратов, учитывающий сложное взаимодействие между заболеваниями и молекулярными мишенями.
English
Current computational approaches for drug design typically focus on generating molecules conditioned on specific targets or general molecular properties, often neglecting the influence of disease context on target behavior and therapeutic outcomes. To address this gap, we introduce DrugGen-2, a novel generative model that designs small molecules conditioned on both disease ontology and target protein sequences. DrugGen-2 was developed by fine-tuning a pre-trained GPT-2 model on a curated dataset of approved drugs linked to their diseases and targets, using a two-step strategy of supervised fine-tuning followed by reinforcement learning via group relative policy optimization (GRPO). This process was guided by reward functions optimizing for chemical validity, novelty, diversity, and high predicted binding affinity. When evaluated on five protein targets relevant to diabetic nephropathy, DrugGen-2 significantly outperformed baseline models (DrugGPT and DrugGen). It demonstrated a superior capacity to generate unique molecules, exhibited greater structural similarity to approved drugs, and achieved improved predicted binding affinities across all targets. Molecular docking analyses further supported these findings, identifying candidate ligands with strong binding potential, including compounds with predicted affinities (-9.917, -9.485, and -9.367) exceeding those of reference drugs such as enalapril for angiotensin-converting enzyme (-8.283). By integrating disease-specific context into molecular generation, DrugGen-2 advances AI-assisted drug discovery, offering a powerful tool for de novo design and drug repurposing that accounts for the complex interplay between diseases and molecular targets.