Command Palette
Search for a command to run...
UniMoMo:面向从头结合剂设计的统一三维分子生成建模
UniMoMo:面向从头结合剂设计的统一三维分子生成建模
Xiangzhe Kong Zishen Zhang Ziting Zhang Rui Jiao Jianzhu Ma Wenbing Huang Kai Liu Yang Liu
摘要
设计靶向特异性分子(如小分子、肽和抗体)对生物学研究和药物发现至关重要。现有的生成方法局限于单一分子域,无法满足多样化的治疗需求,也难以利用跨域可迁移性来提升模型性能。本文提出了统一三维分子生成建模(UniMoMo),这是首个能够使用单一模型设计多个分子域结合剂的框架。具体而言,UniMoMo 将不同分子的表示统一为块图,其中每个块对应一个标准氨基酸或一个分子片段。随后,UniMoMo 采用几何隐空间扩散模型进行三维分子生成,该模型包含一个迭代式全原子自编码器,用于将块压缩为隐空间点,并继之以 E(3) 等变扩散过程。在肽、抗体和小分子上的广泛基准测试表明,我们的统一框架优于现有的域特定模型,凸显了多域训练的优势。
一句话总结
作者提出 UniMoMo,这是首个针对多分子域(肽、抗体和小分子)的从头结合剂设计的统一生成框架,它将分子表示为基于块的图,并组合几何潜在扩散模型与迭代全原子自编码器及 E(3) 等变扩散,性能优于领域专用模型,并凸显了多域训练的好处。
核心贡献
- UniMoMo 是首个使用单一模型统一生成肽、抗体和小分子结合剂的框架,所有分子被表示为块图,其中每个块是一个标准氨基酸或一个分子片段。
- 该方法采用几何潜在扩散模型,结合迭代全原子自编码器将块压缩到潜在空间点,随后进行 E(3) 等变扩散过程,通过降维和减小图规模大幅提升训练与推理效率。
- 在肽、抗体和小分子设计任务上的广泛基准测试表明,该统一框架优于现有的领域专用模型,并展示了跨域迁移能力,例如为同一蛋白口袋生成不同分子类型的结合剂,且具有所需的亲和力。
引言
设计能与目标蛋白结合的分子是药物发现的核心,不同类型的分子(小分子、肽、抗体)具有不同的治疗优势,这推动了专用生成模型的发展。然而,为每种分子类型分别构建模型会错失共享底层物理化学原理和跨类型数据的机会,目前尚无框架能够统一这些不同分子类别的从头结合剂设计。作者通过 UniMoMo 解决了这一缺口,这是一个统一的生成模型,将分子表示为块图(标准氨基酸或分子片段),并采用几何潜在扩散模型:一个迭代自编码器将每个块压缩为低维潜在点,随后扩散模型生成全局排布,从而能够使用单一模型高效地设计多种分子类型的全原子结合剂。
方法
作者提出 UniMoMo,一个用于三维分子结合剂设计的统一生成框架。该方法基于统一的分子表示,将分子建模为块图。每个块代表一个标准氨基酸或通过主子图算法提取的主子图。这种表示统一适用于肽、抗体和小分子。
如框架图所示,核心架构由两个主要组件组成:迭代全原子变分自编码器和几何潜在扩散模型。
迭代全原子变分自编码器在全原子几何与紧凑潜在空间之间建立映射。编码器将分子结合剂 Gx 和结合位点 Gy 分别独立地投影到潜在点云:
Zx=Eϕ(Gx),Zy=Eϕ(Gy)对每个块,潜在表示包括潜在状态和三维坐标,通过重参数化技巧从编码分布中采样。为规范化潜在空间,应用相对先验分布的 Kullback-Leibler 散度约束:
LKL(i)=λ1⋅DKL(N(0,I)∥N(μi,diag(σi)))+λ2⋅DKL(N(ri,I)∥N(μi,diag(σi)))训练时,在解码前向潜在坐标添加随机噪声,以增强解码器对扩散过程引入的不完美性的鲁棒性。
解码器分两阶段重建全原子几何。首先,预测潜在点的块类型,从而通过词汇查找获取原子类型和块内化学键:
{si}=Dξ1(Zx,Zy),Ai,Bi=Lookup(si,V)随后,结构模块迭代重建原子坐标,类似于轻量级流匹配过程:
Xit−Δt=Xit+ΔtVit时间变量从 1.0 逐步递减到 0.0,初始坐标从高斯分布中采样。基于空间邻域预测块间化学键。重建损失包括块类型和键类型的交叉熵、向量场的均方误差,以及在后期时间步施加的成对距离损失,以细化局部几何。编码器和解码器均由等变 Transformer 参数化。
几何潜在扩散模型在压缩的潜在空间中学习结合剂在给定结合位点下的条件分布。扩散过程前,对潜在坐标进行归一化。前向过程逐步向潜在数据添加高斯噪声,将其转化为各向同性高斯先验:
q(uit∣uit−1)=N(uit;1−βt⋅uit−1,βtI)反向过程迭代去噪,以重建原始数据。去噪网络同样实现为等变 Transformer,预测前向过程中添加的噪声。训练目标是最小化预测噪声与实际噪声的均方误差:
LLDM=Et∼U(1…T)[∣Zxt∣∑i∥ϵi−ϵθ(Zxt,Zy,t)[i]∥2]通过在潜在空间中操作,而非直接在全原子几何上,该方法显著降低了训练和采样的计算成本。
实验
UniMoMo 在三类分子结合剂(肽、抗体和小分子)上使用标准基准进行评估,比较单域和多域训练变体。模型在结合恢复、结构合理性和能量方面一致优于领域专用基线,多域数据在泛化能力和相互作用质量上带来明显提升。对 GPCR 靶标的定性分析显示,模型成功地将相互作用模式和局部几何跨结合剂类型进行迁移,生成了化学上合理的候选物,无需力场弛豫。
UniMoMo(全领域)在恢复类天然序列和结合几何方面大幅优于以往的肽设计方法,实现了更强的结合能,以及更高的改进天然结合剂的成功率。多域模型还产生了最真实的局部主链和侧链构象,碰撞率接近参考值,同时多样性与其他方法相当。UniMoMo(全)的结合能为 -34.35,远优于最佳基线 PepGLAD 的 -23.12,更接近天然参考值 -37.25;其 IMP 成功率(40.86%)是 PepGLAD(18.28%)的两倍以上。UniMoMo(全)的外部碰撞率降至 0.93%,几乎匹配参考值(0.88%),而 RFDiffusion 显示出 13.58% 的高外部碰撞率,表明界面堆积较差。
预测模型在 CDR-H3 上实现了更高的单候选序列恢复,但生成方法从更大的候选池中获益显著。UniMoMo 最终产生最佳的类天然恢复,并且当使用 100 个候选时,在大多数复合物中结合能优于天然 CDR,同时多域训练进一步增强了结构合理性。预测基线(MEAN、dyMEAN、GeoAB-R)的单次生成 AAR 为 29–32%,但 IMP 较低(6.7–11.9%)。生成式 DiffAb 从 1 次生成的 24.6% AAR 提升至 10 次生成的 38.4%,IMP 从 10.3% 提升至 34.5%。在采样 100 个候选时,UniMoMo 在 IMP 上超越所有基线,在 65% 的复合物中获得比天然 CDR 更好的结合能。多域训练跨结合剂类型传递知识,与仅抗体训练相比,带来了更低的碰撞率和更准确的二面角分布。
UniMoMo 生成抗体 CDR-H3 环的位阻碰撞率在所有模型中最低,实现的侧链二面角分布远优于唯一报告该指标的其他模型,更接近参考值。其主链二面角分布也非常准确,与最佳基线相当。UniMoMo 实现了最低的内部碰撞率(0.25%)和外部碰撞率(0.06%),表明几何结构比所有基线更干净。UniMoMo 的侧链二面角散度(JSD_sc)为 0.284,远低于 dyMEAN 的 0.702,显示出更真实的侧链构象。
Uni-MoMo 在从头小分子设计中获得最高的总体排名分数,优于所有评估的基线。其块级统一表示实现了对子结构分布的高保真度、良好的药物相似性和合成可及性,以及最低的位阻碰撞。模型受益于多域训练,增强了泛化能力,并在所有评估类别中带来一致提升。Uni-MoMo 在加权得分上位居榜首,超越自回归、扩散、基于片段和基于体素的方法。在子结构指标上表现优异,紧密匹配原子、环和官能团的参考分布。生成分子具有更高的药物相似性和合成可及性,键长和键角分布合理,原子碰撞较少。相互作用特征与参考非常接近,表明蛋白质-配体结合稳定且有意义。多域数据集成在各个方面显著提升性能,减少了单域模型中存在的偏差。
该表比较了基线模型在生成分子与参考分布的原子类型、环类型和官能团匹配程度上的表现。基于扩散的 TargetDiff 在所列基线中实现了最低的原子类型和环类型 JSD,而基于体素的 LIGAN 获得了最小的官能团 MAE。附文指出,Uni-MoMo 超越了所有这些基线,提供了最佳的整体子结构保真度。TargetDiff 在匹配原子类型和环类型分布上优于其他基线,其 JSD 值显著低于 GraphBP 和 Pocket2Mol。GraphBP 在所有子结构指标上始终表现不佳,在原子类型、环和官能团上显示出最高的 JSD 和 MAE。
在肽结合剂、抗体 CDR-H3 和小分子设计任务中,采用多域训练的 UniMoMo 大幅优于先前方法,在恢复类天然序列和结合几何方面表现更佳,实现更强的结合能、更高的成功率,以及更真实的主链和侧链构象,且位阻碰撞极少。通过大候选池的生成采样进一步提升了序列恢复和结合质量,超越预测基线,而多域知识迁移提高了结构合理性和子结构保真度。统一的块级表示获得了最高的总体排名分数,展现了在多样化分子设计问题上的强大泛化能力。