【综述】BIB | AI驱动的蛋白质-适配体复合物预测方法的全面评估

  • 标题: Comprehensive evaluation of artificial intelligence-empowered approaches for protein–aptamer complex prediction
  • 期刊/年份: Briefings in Bioinformatics, 2026, Vol. 27, Issue 3
  • doi: https://doi.org/10.1093/bib/bbag206

背景介绍

这是一篇系统性基准测试综述,旨在回答一个问题:当前最先进的AI结构预测模型能否准确预测蛋白质-适配体(aptamer)复合物的三维结构?适配体是15–100 nt的单链DNA或RNA,具有高亲和力、高特异性和低免疫原性,是肿瘤等疾病治疗的新兴分子。然而,与小分子和抗体药物相比,蛋白质-适配体复合物的AI驱动设计几乎未被探索——公共数据库中这类结构稀缺,适配体本身构象高度灵活,对现有模型构成了独特挑战。

此前虽有CASP16和ProNASet等基准测试,但它们要么仅包含极少量蛋白质-核酸靶标且无法确认是否涉及适配体系统,要么完全不包含蛋白质-适配体复合物。Ochoa等人的研究仅评估了AlphaFold3在混合数据集上的表现,指标单一,难以得出可靠结论。作者的目标是建立首个独立、多维度、特异性感知的基准框架,系统评估AlphaFold3、Chai-1、Boltz-2、RoseTTAFold2NA和3dRNA/DNA五类方法。

综述框架

flowchart TD
    A[蛋白质-适配体复合物预测基准] --> B[基准数据集构建]
    A --> C[模型介绍与原理]
    A --> D[多维度评估体系]
    A --> E[核心发现与讨论]

    B --> B1["11个PDB复合物<br/>(AF3训练截止后)"]
    B --> B2["阳性集 / 错配阴性集<br/>/ 打乱序列对照"]
    B --> B3["含离子 / 无离子输入"]

    C --> C1["AlphaFold3: 扩散架构"]
    C --> C2["Chai-1: AF3+蛋白语言模型"]
    C --> C3["Boltz-2: AF3+亲和力预测"]
    C --> C4["RoseTTAFold2NA: 刚体框架"]
    C --> C5["3dRNA/DNA: 模板组装"]

    D --> D1["结合自由能 ΔGbind<br/>(MM/GBSA)"]
    D --> D2["界面精度 iLDDT"]
    D --> D3["界面氢键 (precision/recall)"]
    D --> D4["MD稳定性 (Rg, RMSD)"]
    D --> D5["口袋占据率 PO"]
    D --> D6["置信度一致性 (ipTM vs iLDDT)"]
    D --> D7["离子效应"]
    D --> D8["适配体单独预测"]

    E --> E1["模型无法区分天然/非天然配对"]
    E --> E2["Boltz-2置信度过高"]
    E --> E3["离子影响有限"]
    E --> E4["适配体构象预测仍是瓶颈"]

各主题核心内容

基准数据集:小而精的设计

作者从PDB中筛选了AlphaFold3训练截止日期(2021年9月30日)后发布的全部11个蛋白质-适配体复合物,排除了同研究的近似变体和含修饰残基的条目,构建了目前最完整的独立基准集。为测试模型对适配体特异性的区分能力,设置了错配阴性集(蛋白与下一复合物的适配体交叉配对)和AF3专属的打乱序列对照(随机排列核苷酸但保留长度和组成,要求至少80%位置与天然序列不同)。11个复合物中,6个属于Boltz-2训练集,5个未见。

五类方法:从扩散模型到模板组装

  • AlphaFold3:基于PairFormer主干和扩散模块直接操作重原子坐标,统一预测蛋白质、核酸、配体、离子。
  • Chai-1:保留AF3核心架构,额外引入蛋白语言模型embedding提升单序列能力,支持实验约束(口袋、接触、对接)。
  • Boltz-2:在AF3基础上优化扩散损失权重(采用EDM公式替代AF3的权重方案),增加可控性机制和蛋白质-小分子亲和力预测模块,训练数据包含MD轨迹。
  • RoseTTAFold2NA:基于刚体框架和扭转角的建模策略,专为蛋白质-核酸复合物设计。
  • 3dRNA/DNA:模板方法,将序列分解为二级结构元件后从模板库匹配组装。

结合自由能:正面与负面对照难以区分

所有模型在阳性集上的ΔGbind与实验值的Pearson相关性均属中等水平(Fig. 1A)。Boltz-2在阳性集上表现最高(训练集包含6个基准复合物),但错配阴性集的相关性与阳性集相似,甚至在某些情况下更接近实验值(Fig. 1B)。AF3对打乱序列对照表现出r = 0.67的高相关性,超过其自身在阳性集和错配阴性集上的表现(Fig. 1C),表明模型即使对无生物学意义的随机序列也能生成看似合理的结合亲和力。LOO分析和bootstrap置信区间显示,由于样本量小,这些相关性估计存在较大不确定性。

Figure 1

界面精度:Boltz-2最优,但存在训练集泄露优势

Boltz-2在全基准集上取得了最高的iLDDT中位数(Fig. 2A),但将数据按训练集归属拆分后,所有模型在D2子集(Boltz-2未见复合物)上的精度均显著下降。AF3和Boltz-2在7LRI、7SZU、8D29、8TQS上中位iLDDT超过77.6%的”非常高精度”阈值,但在8TFD和9GXH上所有模型均未能生成正确界面(Fig. 2B)。RoseTTAFold2NA在8TFD上虽产生正确界面,但精度仅27.2%。

Figure 2

界面氢键:能形成但不能准确复现天然氢键网络

各模型的界面氢键F1分数与iLDDT趋势一致。AF3和Boltz-2在Boltz-2训练集内的6个复合物上recall超过50%,但precision约50%,表明预测的氢键中约一半为非天然相互作用(Fig. 3)。RF2NA在各复合物上氢键精度均最低。重要的是,氢键总数相似并不能保证界面恢复准确——相同的数量可能来自完全不同的接触模式。

MD稳定性:结构稳定≠界面正确

20 ns MD模拟揭示了清晰的复合物和模型依赖性差异。在8TQS等系统中,AF3、Chai-1、Boltz-2的Rg和RMSD接近实验值;在9GXH等挑战性系统中,所有模型均显著偏离。关键发现是错配阴性对照和打乱序列对照在MD过程中也维持了稳定的界面氢键和口袋占据——表面上看起来合理的结合复合物,并不反映真正的生物学识别(Fig. 4, Fig. 5)。RMSD分析进一步揭示偏差可能来源于两种模式:适配体自身构象波动,或适配体相对于蛋白质的整体位移。

Figure 4

Figure 6

置信度陷阱:Boltz-2的ipTM虚高

ipTM与iLDDT的一致性因模型而异(Fig. 8)。Boltz-2几乎对所有复合物给出了>80的ipTM高分,但8TFD、8ZBF、9GXH的iLDDT却很低——高置信度不保证高界面精度。相比之下,AF3和Chai-1的ipTM与iLDDT更一致。Boltz-2的过置信可能源于:更深层的PairFormer置信模块、训综数据包含MD轨迹带来的构象多样性、以及分链PDE/PAE预测头的设计差异。

Figure 8

离子效应与适配体单独预测

在9个含金属离子的复合物上,显式离子输入对AF3和Chai-1的iLDDT无显著改善,Boltz-2仅有小幅统计显著提升。预测的离子位置常与实验不符——有些被置于蛋白/适配体对侧或异常聚集。适配体单独预测(无蛋白约束)时,AF3和Boltz-2更频繁地保持接近结合态的Rg,RF2NA则更常采样扩展构象。8D29等系统的适配体能部分保持折叠,但9GXH等则显著偏离(Fig. 7)。

主要共识

  • 蛋白质组分预测较准确,适配体仍是瓶颈:AF3、Chai-1、Boltz-2普遍能较好地捕捉蛋白质构象,但适配体区域的偏差是整体误差的主要来源。
  • 扩散架构有效但非充分:基于扩散的去噪生成策略能够产生结构合理的复合物,但在区分序列特异性识别方面存在根本性局限。
  • 单个指标不足以评估预测质量:结构合理性、MD稳定性、或有利的ΔGbind都可能来自非特异性表面附着,必须结合多维度、特异性感知的评估。

主要争议 / 未解决问题

  • Boltz-2的过置信是bug还是feature? Boltz-2的置信模块结构不同且训练数据包含动态信息,其ipTM虚高可能反映了更”宽容”的构象空间认知,但这在蛋白质-适配体系统中尤为突出,尚未确定是先验偏差还是系统性问题。如果是系统性的,该偏差可能通过ipTM在亲和力预测管线中的筛选作用向下游传播。
  • 有限样本量下的统计稳健性:11个复合物的样本量导致bootstrap置信区间宽泛,LOO分析的离群值提示个别复合物对整体结论影响显著。Boltz-2训练集内子集甚至出现负相关(-0.48),而未见子集反而正相关(0.91),凸显子集划分对结论的颠覆性影响。
  • MD时长是否足够? 20 ns能揭示模型间差异,但作者自行的100 ns扩展模拟显示ΔGbind和界面氢键在更长时间窗内仍敏感变化。PO相对稳定,但精细界面描述符的定量值可能仍受分析窗口影响。

未来展望

  • 扩展基准数据集:随着PDB中蛋白质-适配体复合物的增长,未来基准应纳入更多样化的拓扑类型,特别是G-四链体和双链/G-四链体系统。
  • 引入核酸特异性指标:除传统的iLDDT和RMSD外,应纳入碱基配对和碱基堆积精度等适配体特异的评价维度,参考Ochoa等人的工作。
  • 改进特异性控制设计:当前打乱序列对照仅限于AF3,未来应将此类对照扩展到所有模型,并设计更严格的诱饵适配体序列以挑战模型的判别能力。
  • 离子建模的专项改进:离子预测位置偏差提示需要在训练中强化离子-核酸相互作用的表征,尤其在G-四链体等依赖特定离子稳定的折叠类型中。
  • 长期MD与增强采样:对关键系统进行更长时间尺度的模拟或使用增强采样方法,以获得收敛更好的能量估计和更完整的构象适应图景。