Nesso-1:开源共折叠模型如何重塑药物结合亲和力预测的范式

1 阅读

在药物研发的漫长征程中,预测小分子与靶蛋白的结合亲和力始终是核心挑战之一。这一预测不仅关乎化合物能否有效作用于目标靶点,更直接影响药物的疗效与安全性。近年来,人工智能技术的迅猛发展为这一领域带来了革命性变革,而Nesso-1的发布则标志着开源模型在结合亲和力预测上迈出了关键一步。

architecture_diagram-2

结合亲和力:药物设计的基石

结合亲和力决定了化合物与靶标结合的强度,是评估候选药物潜力的首要指标。在药物发现早期,研究人员需要在海量化合物中筛选出具有初步活性的“命中物”,这一阶段对速度的要求极为苛刻。随着候选化合物进入优化阶段,对亲和力的精确预测变得至关重要,因为微小的结构差异可能导致结合能力的显著变化。

传统方法在应对这一挑战时,往往需要在计算速度和物理精度之间做出取舍。基于物理的模拟方法虽然准确,但计算成本高昂,难以应用于大规模筛选。而基于结构的快速对接方法虽然速度快,但精度有限,无法捕捉蛋白质的柔性和动态变化。这种权衡长期制约着药物发现的效率。

打破物理范式的AI革命

AlphaFold 2的成功证明了深度学习在蛋白质结构预测上的巨大潜力,而共折叠模型的兴起则进一步将这一能力扩展到蛋白质-配体复合物。这些模型能够直接预测结合状态下的三维结构,绕过了传统对接的诸多限制。然而,早期的共折叠模型如Boltz-2虽然性能卓越,但计算开销依然庞大,且大部分先进技术被封闭在商业公司内部。

Nesso-1的出现打破了这一局面。作为一款完全开源的粗粒化共折叠模型,它在保持高精度的同时,将单次预测时间缩短至1秒以内,比Boltz-2快一个数量级以上。这一突破使得大规模虚拟筛选成为可能,为药物发现早期阶段提供了前所未有的效率。

当前AI结构药物设计的四大挑战

尽管共折叠模型展现出巨大潜力,但该领域仍面临诸多挑战。首先,闭源瓶颈严重阻碍了技术进步的可复现性和社区协作。其次,共折叠模型的计算成本依然较高,难以在超大规模化合物库中应用。第三,人类设计者倾向于依赖三维结构和物理原理,而AI模型可能更适合在潜在空间中直接推理,这种归纳偏置的差异需要重新审视。最后,公共基准的泄漏问题导致模型性能被高估,掩盖了真实世界中的泛化能力不足。

project_A_selectivity

Nesso-1的创新架构与性能优势

Nesso-1的设计理念是“少即是多”。它摒弃了全原子生成模块,采用token级别的结构表示,每个残基对应一个token,从而大幅简化了网络结构。同时,去除了MSA模块,仅依靠成对表示进行推理,进一步降低了计算复杂度。这种设计使得Nesso-1能够处理长达800-900个残基的靶标,且单次预测仅需1秒。

在性能上,Nesso-1在多个公共基准和内部实验中均达到或超越了Boltz-2的水平。更重要的是,它在真实药物化学场景中的表现尤为突出,这得益于其训练和评估策略的改进。Nesso-1的开发者意识到公共基准的局限性,因此引入了OpenBind基准和25个内部生化实验,这些数据更贴近实际应用场景,能够更真实地反映模型的泛化能力。

report_speed_and_affinity

超越基准:真实世界中的评估与挑战

chemistry_similarity

在开发过程中,研究团队发现,过度优化公共基准会导致模型在分布外数据上的性能下降。例如,在FEP+基准上取得最佳性能的模型,在内部实验中却表现不佳。这揭示了现有评估策略的缺陷,即仅基于序列相似性的数据划分无法有效防止记忆效应。Nesso-1虽然遵循这些约束以进行公平比较,但未来将转向更严格的数据划分方法。

在真实世界的评估中,Nesso-1在大多数情况下优于Boltz-2,但在某些困难靶标上仍存在相关性不足的问题。这表明,尽管粗粒化策略在多数场景下有效,但在处理复杂相互作用时,全原子分辨率可能仍然必要。研究团队计划进一步探索如何在不牺牲效率的前提下,引入更精细的结构信息。

开源与未来展望

Nesso-1的发布不仅是技术上的突破,更是开放科学理念的实践。其权重和代码完全开源,允许社区自由使用和改进。这一举措有望加速整个领域的发展,促进更多创新方法的涌现。

展望未来,Nesso-1团队将继续优化模型性能,探索更高效的结构表示方法,并计划引入更严格的数据划分策略。同时,他们也在研究如何将模型与外部物理验证相结合,以提升预测的可靠性。随着这些改进的落地,Nesso-1有望成为药物发现领域不可或缺的基础工具。

在药物研发的征途上,Nesso-1代表了一次重要的范式转移。它证明了开源模型能够在速度和精度上同时超越传统方法,为AI驱动的药物设计开辟了新的可能性。尽管挑战依然存在,但这一进展无疑为整个行业注入了新的活力。