AI 制药公司 Deep Origin 本月宣布,其 AI 药物发现框架在针对一种癌症免疫疗法酶的虚拟筛选中实现了近 31% 的命中率,约为常见机器学习方法的 100 倍。该公司表示,这一突破源于其将基于物理的模拟与 AI 方法(包括新的共折叠模型)相结合的策略。

计算药物发现的一大挑战是构建既准确又具有泛化能力的模型。基于深度学习的共折叠模型(如 AlphaFold 和 Boltz-1)在大量现有分子数据上训练,提升了预测能力,在某些情况下准确率可超过 80%。然而,当这些模型面对全新化合物时,准确率会显著下降,预测配体与蛋白质的匹配变得困难。据 Deep Origin 称,在实际应用中,基于 AI 的虚拟筛选方法因大量假阳性,通常只能发现约 1% 的新药候选物。

Deep Origin 旨在通过其 AI 药物发现框架克服这一局限,该框架包含两款产品:DODock,一个结合 AI 与物理的分子对接引擎;以及 DOScore,用于估算超大规模化学空间中热力学结合亲和力的引擎。DODock 将扩散模型与基于物理的搜索和精化阶段相结合,后者基于 Vina 风格的能量函数(DOFast)和增强的全局优化器。公司网站称,其目标是“将学习组件放在能增加价值的地方(提出和排序姿势),并在需要泛化的地方保留可解释、低参数的物理模型”。

物理模型的使用使 DODock 能够基于第一性原理而非先验数据进行推理,从而在全新靶点上保持准确性,而纯 AI 方法在此类情况下会失去精度。Deep Origin 表示,AI 与物理建模的结合是其关键差异化因素。将既有的 C++ 和 Fortran 物理引擎移植到 GPU 上也是一项技术挑战,并非所有公司都能克服。公司对 HPCwire 表示:“构建物理-ML 混合模型需要量子力学、分子动力学力场和可微神经网络架构的深度集成,大多数初创公司缺乏同时掌握两者的架构和技能。”

Deep Origin 由 Michael AntonovGaregin Papoian2022 年创立,公司表示对 AI 药物发现采取长期视角。首席科学官 Papoian 表示:“虚拟筛选已广泛使用超过 40 年,却很少真正产出药物。该领域习惯了较低的准确率上限。我们希望通过将物理与机器学习结合来改变这一现状,确保我们的方法在训练数据不足的新靶点上仍能保持准确性。”

公司还强调其“零泄漏”数据分割方法。为测试和验证 AI,Deep Origin 使用“严格的双重相似性过滤器”,移除任何序列同一性超过 30% 的蛋白质,以及 Tanimoto 相似度超过 0.4 的配体。这些方法使公司能够在没有现有晶体学数据或已知小分子结合剂的情况下,成功对新型生物靶点进行虚拟筛选。公司声称,在纯 AI/ML 方法失败的情况下,其姿态准确率可维持在 50% 至 89%

这家位于旧金山的公司已融资 8200 万美元,并在 BioRxiv 上发表了针对包含超过 800 亿化合物的合成化合物库的湿实验验证论文。Deep Origin 重点展示了四种化合物的结果,包括 CD73(核苷酸酶)、IRAK4(激酶)、Factor XIa(蛋白酶)和 IL-17A(蛋白质-蛋白质相互作用靶点)。在所有四个靶点上,其命中物表现出高骨架新颖性,ECFP4 Tanimoto 相似度为 0.22–0.27。公司表示,这些筛选发现了全新的化学物质,而非现有药物的微小变体。

针对 CD73(在减缓癌症生长中起重要作用),Deep Origin 实现了 30.6% 的命中率,约为纯 AI/ML 方法的 100 倍。CEO Antonov 表示:“重要的是筛选在尚未被解决的靶点上的表现,因此我们在严格分割和设计使其失败的案例上测试了模型。模型在这些严格测试中的表现,而非在虚高的基准上,决定了带到实验台上的分子有多少可能是真实的。”