微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 香港大学与国际数字经济学院联合攻克AI分子设计的"多样性困境":让药物生成器既能找到好药,又不陷入"偏执"

香港大学与国际数字经济学院联合攻克AI分子设计的"多样性困境":让药物生成器既能找到好药,又不陷入"偏执"

2026-05-15 11:16
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-05-15 11:16 科技行者

这项由香港大学、国际数字经济学院、北京协同创新研究院、北京大学和耶鲁大学联合开展的研究,以预印本形式发布于2026年5月,论文编号为arXiv:2605.08659,有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。

在现代药物研发的世界里,科学家越来越依赖人工智能来"设计"新分子。这些AI系统就像一台不知疲倦的化学家助手,能在极短时间内提出海量候选药物分子。然而,当研究人员开始用奖励信号训练这些AI,让它们专注于找到"最好的"分子时,一个令人头疼的问题逐渐浮出水面——AI开始"偏执"了。

这种偏执不是心理问题,而是一种技术现象:当你反复告诉AI"这类分子是好的",它就会越来越多地生成同一类型的分子,最终把所有"鸡蛋"都放进同一个篮子里。在药物研发中,这是非常危险的。药物研发领域有一个行业共识:多样性是成功的关键。不同的分子骨架可能针对不同的患者群体,在不同的病理环境下发挥作用,而且当某条化学路径走不通时,备选方案越多,研发成功的概率就越高。这种AI的"偏执"现象在学术上被称为"模式坍缩"(mode collapse)——生成的内容越来越集中,越来越雷同。

正是为了解决这个核心矛盾,研究团队提出了一种名为"超组相对策略优化"(Supergroup Relative Policy Optimization,简称SGRPO)的新训练框架。这个名字听起来颇为技术化,但背后的核心思路其实可以用一个日常场景来理解:如何在一场厨艺比赛中,既让每道菜都美味,又确保整桌菜品风格多样、不重复。

一、AI药物设计的"偏食"困境:为什么光追求"好"还不够

要理解这项研究解决的问题,先得明白AI分子生成器是怎么工作的。把AI分子生成器想象成一个厨师。这位厨师会不断尝试新食谱,然后有人对它做出的菜打分——口感、营养、卖相。如果厨师只追求高分,它很快就会发现"红烧肉"总能得高分,于是开始每天做红烧肉,甚至把所有菜都做成类似红烧肉的风格。最后,虽然每道菜分数都不低,但整桌菜单变成了"红烧肉全席"。

在AI分子设计领域,这个比喻对应的是一个叫做强化学习(Reinforcement Learning)的训练方法。研究团队用奖励信号告诉AI哪种分子更好——比如更像药物、更容易合成、对目标蛋白结合力更强。AI就会调整自己的策略,越来越多地生成高分分子。问题在于,高分分子往往属于类似的化学家族,AI最终陷入"只会做一道菜"的困境。

这个问题有多严重?现有的一些解决方案试图通过"记忆"机制来应对——AI会记住自己之前生成过的分子,如果新生成的分子和历史记录太像,就扣分惩罚它。这相当于告诉厨师"你上周做过红烧肉了,今天别再做了"。虽然这个方法有一定效果,但它存在一个根本性的局限:它比较的是新菜和"历史菜单"的关系,而不是"今天这一桌菜"之间的关系。厨师可能因为上周做了红烧肉而被罚,但今天同时做了五道风格相近的蒸菜,却没有人注意到。

这个问题的本质是:多样性是一个"集合属性"——它描述的是一批候选方案作为整体的特性,而不是单个方案的特性。正如"百花齐放"描述的是花园的整体状态,而非某朵花的特点。现有的AI训练方法大多是对每个单独生成的分子打分,没有办法直接衡量和奖励这种集合层面的多样性。研究团队将此称为核心挑战:如何把"集合层面的多样性"变成可以直接优化的训练目标,同时还要把这个集合奖励合理地分配给每个具体的分子?

二、超组策略:像美食评委一样同时审视整桌菜

SGRPO的核心思路可以用一场高级厨艺竞赛来理解。在这场比赛中,评委不是一道一道菜孤立地打分,而是同时端出几桌菜,然后比较哪桌菜的组合更加多样、丰富。

具体来说,对于同一个设计任务(比如"设计能结合某种蛋白质口袋的分子"),SGRPO会让AI同时生成好几组候选方案,每组包含若干个分子。研究团队把这个总体集合称为"超组"(supergroup)。每组分子就像竞赛中的一桌菜,超组就是参加比赛的所有桌子。

评判过程分两个层次进行。第一层是对每个具体分子单独打分,衡量它是否是一个好分子——药物属性好不好、合成难度如何、和目标蛋白的结合力如何。这就是厨艺比赛中对每道菜单独评判口味和品质。第二层是对每一组分子作为整体打分,衡量这组分子的多样性——它们彼此之间是否够不同、是否覆盖了足够多的化学类型。这就是评委评判整桌菜是否丰盛多样。

接下来有一个聪明的设计:对组级多样性的比较只在同一个超组内进行。这意味着所有比较的任务条件是一样的,排除了不同任务难度的干扰——就好像厨艺比赛必须所有厨师做同一道主题的菜,才能公平比较谁的菜单更多样。

这种"超组内部比较"用了一个具体的数学方法:对于超组里的每一组,计算它的多样性得分与其他组的平均分之差。如果某组的多样性高于平均水平,它就获得正向奖励;如果低于平均水平,就得到负向惩罚。用厨艺比赛的语言来说就是:你这桌菜是否比其他参赛者的菜单更丰富多彩?

三、"谁的功劳":把集合奖励公平分配给每一个分子

拿到了组级多样性的评分之后,还面临一个难题:AI在训练时需要针对每一个单独的分子更新策略,但多样性评分是给整组打的,怎么告诉AI"这个分子对组的多样性贡献了多少"?

研究团队用了一个叫做"留一法贡献"(leave-one-out contribution)的方法。道理很直观:把某个分子从组里拿掉,看看整组的多样性分数下降了多少。下降越多,说明这个分子对组的多样性贡献越大;下降越少甚至不变,说明这个分子是个"可有可无"的复制品。

这就好比在评价合唱团中每个成员的贡献时,让每人轮流暂时退出,听听缺了谁之后音乐最没味道,那个人的贡献就最大。

为了让这种贡献的分配更加精细,研究团队设计了一种"符号感知"的权重机制。如果一组分子的整体多样性比其他组好(获得了正奖励),那么在这组内部,贡献了更多独特性的分子会获得更多奖励;贡献少的分子奖励就少。反过来,如果这组分子的多样性比其他组差(得到了负惩罚),那么在组内,那些本来就雷同、没什么独特性的分子会被加重惩罚;而少数几个还算有独特性的分子受到的惩罚就相对轻一些。整套设计保证了一个重要性质:重新分配之后,每个分子的奖励加起来还是等于原来的组级奖励,不多不少。

四、把两种奖励合并:既要好又要不同

有了每个分子的质量评分(单体奖励)和多样性贡献评分(来自组级多样性的分配),SGRPO最后把这两个分数用一个可调节的权重参数合并成一个总奖励。这个参数(文中称为λ)控制着"追求单体质量"和"追求集合多样性"之间的平衡:λ越大,多样性的权重越高;λ越小,质量的权重越高。

最终的训练信号被称为"超组相对优势"——它衡量的是某个分子的总奖励与超组内所有分子平均总奖励的偏差。简单说就是:这个分子在质量和多样性的综合表现上,比同一批次生成的其他分子好多少或差多少?然后用这个相对优势去更新AI的策略,让AI学会如何生成那些既有质量、又对组的多样性有贡献的分子。

整个训练过程还加入了一个"锚点"机制(KL正则化),防止AI在追求奖励时走偏太远,偏离预训练模型学到的合理化学知识。这就像给厨师一个守则:在追求创新菜单的同时,不能完全抛弃基本的烹饪原则。

五、在三种分子设计任务上的实战测验

研究团队在三类具体任务上对SGRPO进行了全面测试,每类任务都代表了生物分子设计中的一种典型场景。

第一类是"无条件从头小分子设计"。这就像在没有任何指定主题的情况下,让AI自由创作新药分子。使用的基础模型是GenMol——一种通过迭代去噪生成分子SAFE字符串的离散扩散语言模型。由于GenMol不是传统的自回归语言模型,直接套用标准GRPO训练方法有技术障碍,研究团队因此采用了一种叫做coupled-GRPO(耦合GRPO)的变体来适配扩散式生成过程。评估的质量指标是QED(药物相似性分数,衡量分子"看起来像不像药")和SA(合成可及性评分,衡量分子是否容易合成)的加权组合;多样性则用Morgan分子指纹的Tanimoto距离来衡量——两个分子的化学结构差异越大,多样性分数越高。

第二类是"基于蛋白口袋的小分子设计"。这一次,AI不是漫无目的地创作,而是要针对特定的蛋白质"口袋"(蛋白质表面能与药物结合的凹陷区域)设计合适的配体分子。这类任务更贴近真实药物研发场景——你要设计的分子不仅要长得像药,还要能和特定的疾病靶点紧密结合。研究团队专门开发了GenMol-P,这是GenMol的"升级版",通过引入蛋白质口袋的结构信息作为前缀条件,让模型知道自己在为哪种口袋设计分子。具体实现方式是:用一个冻结的ESM-IF1蛋白编码器把口袋结构转换成嵌入向量,再通过一个可训练的两层投影网络映射到分子生成器的隐藏空间。质量评分中加入了AutoDock Vina对接分数,这是一种模拟分子和蛋白质口袋结合强度的计算方法,分数越负越好。多样性的计算针对同一口袋生成的分子集合,避免把不同口袋的分子混在一起统计,那样会产生虚假的多样性。

第三类是"无条件从头蛋白质设计"。这次的目标不是小分子,而是氨基酸序列——蛋白质的基本构成单位。使用的基础模型是ProGen2,一种自回归氨基酸语言模型,可以直接生成蛋白质序列。由于ProGen2是标准自回归模型,可以直接使用原始GRPO,无需耦合版本。质量评估整合了四个维度:自然性(通过ESM2语言模型的序列概率判断蛋白质是否"看起来合理")、可折叠性(通过ESMFold预测的结构置信度)、稳定性(通过TemBERTure预测的热稳定性)和可开发性(通过蛋白质溶解度和结构风险评分衡量是否容易生产和使用)。多样性则用标准化的编辑距离相似度来衡量——两条氨基酸序列改动越少就能互相转换,说明它们越相似、多样性越低。

六、"效用-多样性帕累托前沿":一把衡量好坏的精妙标尺

要理解这项研究是怎么评估成果的,先得理解一个关键概念。AI模型生成的结果取决于很多调节参数,比如"温度"参数——温度越低,AI越保守,倾向于生成高分但雷同的分子;温度越高,AI越随机,生成的分子更多样但质量可能下降。

研究团队对每个模型都跑了一系列不同温度设置下的生成结果,记录每个设置下的"平均质量"和"整体多样性",形成一批数据点。把这些点画在坐标轴上——横轴是质量,纵轴是多样性——可以看到一条曲线。这条曲线上质量和多样性互相制约的最优点集合,就是"帕累托前沿"(Pareto frontier)。帕累托前沿越靠向右上角(质量越高、多样性越大),说明模型越强。

为了量化这条曲线的好坏,研究团队使用了三个指标。超体积(HV)衡量帕累托前沿所覆盖的面积,面积越大越好。理想点距离(DIP)衡量帕累托前沿上的最优点到"质量和多样性都是满分"这个假想理想点的距离,距离越小越好。R2指标则在不同的质量-多样性偏好权重下,综合衡量帕累托前沿的整体表现,值越小越好。

对比的基准线包括四种方法:没有经过强化学习后训练的原始预训练模型、只优化质量的耦合GRPO、记忆辅助的GRPO(通过历史记录惩罚重复)以及SGRPO本身。

七、三场测验的成绩单:SGRPO如何表现?

在无条件小分子设计任务中,四种方法在保守解码设置下表现差距不大,分子质量和多样性都处于中等水平。但当调节参数推向高质量端时,差异开始显现。耦合GRPO和记忆辅助GRPO的多样性会迅速崩塌,整体前沿曲线出现急剧向下弯折的态势。耦合SGRPO的多样性下降则明显更慢,前沿曲线更向右延伸,维持住了更高的多样性水平。在量化指标上,耦合SGRPO的超体积达到0.0672,高于原始模型的0.0579和耦合GRPO的0.0629;理想点距离为0.2551,优于其他三种方法;R2指标为0.0979,同样最优。这说明SGRPO主要的作用不是在所有操作点都提升表现,而是在高质量端延缓多样性的崩塌。

在基于蛋白口袋的小分子设计任务中,SGRPO的优势最为突出。这正是因为口袋条件设计任务本身就有极强的"聚焦"压力——AI会集中优化对接分数,很容易固化在几个高分的化学骨架上。耦合GRPO确实能提升质量,但代价是口袋内多样性的大幅牺牲。耦合SGRPO的帕累托曲线则明显向外扩展,在相近的质量水平下保持了高得多的口袋内多样性。超体积从原始模型的0.0293一跃升至0.0654,而耦合GRPO只有0.0090;理想点距离从0.4643降到了0.3818,而耦合GRPO高达0.7527。这组数据揭示了一个重要规律:越是条件收紧、任务目标明确的场景,直接奖励集合多样性的策略越有价值。

在从头蛋白质设计任务中,原始ProGen2模型的帕累托前沿作为基准,超体积为0.2708,整体表现不错但可以提升。耦合GRPO训练后质量提升,但多样性大幅下降,超体积跌至0.2078。记忆辅助GRPO的情况更糟,多样性出现最严重的模式坍缩,超体积仅剩0.0245,远低于没有做任何强化学习的原始模型。SGRPO则达到了最高的超体积0.3627,理想点距离0.3538,R2指标0.1693,三项指标均最优。这意味着SGRPO不仅超越了其他后训练方法,甚至在帕累托前沿层面超过了原始模型——这是一个特别有意义的结果,因为它说明SGRPO不只是在"防止退化",而是真正地推进了模型的整体能力边界。

八、拆开黑盒:SGRPO为什么能做到这一点?

为了理解SGRPO内部的运作机制,研究团队从多个角度做了深入分析。

消融实验是最直接的拆解方式。研究团队在无条件小分子设计任务上分别移除了SGRPO的两个关键组件,观察性能变化。当完全去掉多样性奖励时,方法退化为耦合GRPO,帕累托前沿最差。加入超组多样性奖励但不使用留一法贡献分配时,前沿有明显改善,说明组级多样性压力本身就有效果。使用完整SGRPO(包含留一法分配)时,前沿进一步改善,说明精细的个体贡献分配对于进一步提升效果是必要的。

为了更直观地理解训练过程中发生了什么,研究团队利用蛋白质设计任务进行了分布动态分析。他们对三种后训练方法在训练的三个时间节点(初始、20步后、100步后)各生成一批序列,把所有序列混合后用UMAP降维可视化(UMAP是一种把高维数据压缩到二维平面展示的技术),这样可以直观地看到不同序列的聚集模式。结果非常清晰:训练20步后,GRPO和记忆辅助GRPO各自收缩进了一个相对集中的区域,而SGRPO的序列分散在多个不同的簇里,覆盖了更广泛的序列空间。随着训练到100步,GRPO继续收缩,变得更加集中;记忆辅助GRPO则出现了一种奇怪的漂移——它确实离开了原来的高密度区域(这是记忆惩罚的效果),但却朝向一个孤立的远端区域聚集,说明记忆惩罚驱动的是"逃离熟悉区域"而非"探索整体空间"。SGRPO则在保持多个簇的同时,每个簇内的序列质量逐步提升。这组可视化结果生动地解释了为什么SGRPO能在保持多样性的同时提升质量,而不是像其他方法一样牺牲其中一个。

关于组大小对性能的影响,研究团队做了一个系统测试:在总样本量不变的前提下,把超组分成不同大小的组(组大小K从1到64),K=1相当于退化回普通GRPO。结果显示,哪怕是K=4的近最小设置,SGRPO就已经明显优于K=1(普通GRPO)。随着组变大,性能逐步提升,但提升幅度递减。这说明SGRPO不需要极大的组规模就能工作,在计算资源有限时也可以实用。

关于多样性奖励权重λ的敏感性,研究团队测试了λ从0到0.9的多个取值。结果表明,只要λ大于0(即加入任何多样性奖励),SGRPO都优于纯质量优化的GRPO。性能在λ=0.5附近达到峰值,说明质量和多样性各占一半权重是最优平衡点。这个结果展示了SGRPO对超参数的鲁棒性——不需要精心调参,大范围内都能有效。

九、研究的边界与未来方向

研究团队在论文中也坦诚地讨论了SGRPO的局限性和改进空间。

从计算成本来看,SGRPO需要对同一个条件生成多组样本,并计算组内所有分子对之间的相似度。对于使用Morgan指纹的小分子任务,相似度矩阵的构建是主要的额外开销;对于蛋白质序列,编辑距离的计算同样需要额外时间。不过,这个开销的实际大小取决于组大小K和相似度计算的成本,研究团队也指出,由于同一相似度矩阵可以同时服务于组级多样性评分和留一法贡献计算,不需要重复计算,实际overhead并不像看起来那么大。与记忆辅助GRPO相比,随着训练步骤增加,记忆库中的历史条目越来越多,查询开销也在增长,所以两者在计算上各有取舍。

从适用场景来看,这项工作刻意保持了SGRPO的通用性,没有针对某个特定的分子类型、任务或多样性指标做深度定制。这种通用性让SGRPO能够横跨多种任务和模型架构,但也意味着对某些具体场景来说,专门设计的多样性奖励可能效果更好。例如,在药物化学中,"骨架多样性"(scaffold diversity)往往比整体分子指纹多样性更重要;在蛋白质工程中,功能分区的多样性可能比序列编辑距离更有意义。研究团队明确指出,这些更专门化的实例化留给未来工作探索。

此外,当前的评估以研究团队定义的质量和多样性指标为轴,这些指标本身的选择和权重设计也是整个系统的一部分。如何选择、校准和验证这些组成指标,是所有基于奖励的后训练方法共同面对的问题,不是SGRPO特有的,但仍然是实际应用中的重要挑战。

说到底,这项研究做的事情可以用一句话概括:它让AI药物设计系统学会了"在优秀的前提下,保持多样化",而不是一味追求"最好的那一个"。在真实的药物研发中,这种能力可能意味着某个疾病领域能有更多条可以探索的化学路径,某个难以成药的靶点能有更多不同骨架的候选分子等待测试,以及面对患者个体差异时有更丰富的方案储备。

从技术层面看,SGRPO展示了一种优雅的思路:把"集合属性"变成可训练的目标,不是通过间接的代理指标(比如历史记忆),而是直接在训练时对生成的集合进行比较和评分。这个思路本身超越了药物设计的范畴,对任何需要同时追求质量和多样性的生成式AI任务都有参考价值——比如设计多样化的广告文案、生成覆盖不同风格的音乐旋律,或者在机器人设计中探索多样化的机械结构。

归根结底,好的AI系统不应该只会"炒一道好菜",而应该能端出一桌各有特色又各自精彩的佳肴。SGRPO在这个方向迈出了可验证、可复现的一步。有兴趣深入了解技术细节的读者,可通过arXiv编号2605.08659查阅完整论文,相关代码也已在GitHub的IDEA-XL/SGRPO仓库公开发布。

Q&A

Q1:SGRPO和普通GRPO有什么本质区别?

A:GRPO只对每个单独生成的分子打质量分数,然后根据这个分数更新AI策略,结果AI会越来越集中在高分的化学类型上,多样性崩塌。SGRPO在此基础上增加了一个关键步骤:对同一条件下生成的多组分子,直接计算每组的整体多样性并与其他组比较,再通过留一法把组级多样性奖励分配给每个具体分子。这样AI在学习时不仅知道"这个分子质量好不好",还知道"这个分子对整组多样性的贡献多不多",从而同时优化两个目标。

Q2:SGRPO生成的分子多样性更高,会不会导致质量变差?

A:实验数据显示,SGRPO在三个任务中都达到了最好的帕累托前沿,这意味着在相同质量水平下多样性更高,在相同多样性水平下质量也更高。特别是在蛋白质设计任务中,SGRPO甚至超过了没有经过强化学习的原始预训练模型。这说明SGRPO不是在质量和多样性之间做简单取舍,而是真正拓展了两者同时可达的范围边界。

Q3:超组的组大小设置对SGRPO效果影响大吗?

A:影响存在但并非决定性的。研究测试了从K=4到K=64的不同组大小,发现哪怕最小的K=4设置,SGRPO就已经明显优于K=1(即普通GRPO)。组越大,多样性估计越准确,性能也越好,但提升幅度是递减的。这说明SGRPO在计算资源有限、只能用小组的情况下依然实用,不需要非常大的组才能发挥作用。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-