ChatPaper.aiChatPaper

Het verleggen van de grenzen van biomoleculair nut en diversiteit met Supergroup Relative Policy Optimization

Pushing Biomolecular Utility-Diversity Frontiers with Supergroup Relative Policy Optimization

May 9, 2026
Auteurs: Xinwu Ye, He Cao, Hao Li, Bin Feng, Zijing Liu, Xiangru Tang, Yu Li, Shenghua Gao
cs.AI

Samenvatting

Biomoleculaire generatoren worden vaak aangepast met beloningsfeedback om het taakspecifieke nut te verbeteren, maar het uitsluitend nastreven van nut kan de generatie concentreren op een smalle familie van kandidaten. Het handhaven van diversiteit is moeilijk omdat steekproefdiversiteit een eigenschap op setniveau is. We introduceren Supergroup Relative Policy Optimization (SGRPO), een flexibel GRPO-achtig raamwerk dat direct beloningen construeert uit diversiteit op setniveau. Voor elke conditie bemonstert SGRPO een supergroep van kandidaatsets, vergelijkt hun diversiteit onder dezelfde conditie, en herverdeelt de groepsdiversiteitsbeloning naar individuele rollouts via leave-one-out diversiteitsbijdragen, alvorens deze te combineren met het nut op rolloutniveau. Dit ontwerp ontkoppelt SGRPO van een specifieke generator, nutsbeloning of diversiteitsmaatstaf, en maakt instantiatie met verschillende GRPO-achtige benaderingen mogelijk. We evalueren SGRPO op de novo ontwerp van kleine moleculen, pocket-gebaseerd ontwerp van kleine moleculen, en de novo eiwitontwerp, waarbij we het zowel met GRPO als met Coupled-GRPO instantiëren voor autoregressieve en discrete diffusiegeneratoren. Bij decoderingsoverzichten (decoding sweeps) verbreedt SGRPO de Pareto-grens van nut en diversiteit en behaalt het de beste grens-niveau metrics ten opzichte van voorgetrainde generatoren, GRPO en, waar van toepassing, geheugenondersteunde GRPO. Onze analyses tonen verder aan dat directe diversiteitsbeloningen op setniveau effectief blijven met kleine groepen en helpen om een bredere dekkingsgraad van de generatieverdeling te behouden tijdens nabewerking (post-training). De code is beschikbaar op https://github.com/IDEA-XL/SGRPO.
English
Biomolecular generators are often adapted with reward feedback to improve task-specific utility, but pushing utility alone can concentrate generation on a narrow family of candidates. Maintaining diversity is difficult because sample diversity is a set-level property. We introduce Supergroup Relative Policy Optimization (SGRPO), a flexible GRPO-style framework that directly constructs rewards from set-level diversity. For each condition, SGRPO samples a supergroup of candidate sets, compares their diversity under the same condition, and redistributes the group diversity reward to individual rollouts through leave-one-out diversity contributions before combining it with rollout-level utility. This design decouples SGRPO from a particular generator, utility reward, or diversity metric, and allows instantiation with different GRPO-style approaches. We evaluate SGRPO on de novo small-molecule design, pocket-based small-molecule design, and de novo protein design, instantiating it with both GRPO and Coupled-GRPO across autoregressive and discrete diffusion generators. Across decoding sweeps, SGRPO expands the utility-diversity Pareto frontier and achieves the best frontier-level metrics relative to pretrained generators, GRPO, and memory-assisted GRPO when applicable. Our analyses further show that direct set-level diversity rewards remain effective with small groups and help preserve broader generation-distribution coverage during post-training. The code is available at https://github.com/IDEA-XL/SGRPO.