AI 製藥公司 Deep Origin 本月宣佈,其 AI 藥物發現框架在針對一種癌症免疫療法酶的虛擬篩選中實現了近 31% 的命中率,約為常見機器學習方法的 100 倍。該公司表示,這一突破源於其將基於物理的模擬與 AI 方法(包括新的共摺疊模型)相結合的策略。
計算藥物發現的一大挑戰是構建既準確又具有泛化能力的模型。基於深度學習的共摺疊模型(如 AlphaFold 和 Boltz-1)在大量現有分子資料上訓練,提升了預測能力,在某些情況下準確率可超過 80%。然而,當這些模型面對全新化合物時,準確率會顯著下降,預測配體與蛋白質的匹配變得困難。據 Deep Origin 稱,在實際應用中,基於 AI 的虛擬篩選方法因大量假陽性,通常只能發現約 1% 的新藥候選物。
Deep Origin 旨在通過其 AI 藥物發現框架克服這一侷限,該框架包含兩款產品:DODock,一個結合 AI 與物理的分子對接引擎;以及 DOScore,用於估算超大規模化學空間中熱力學結合親和力的引擎。DODock 將擴散模型與基於物理的搜尋和精化階段相結合,後者基於 Vina 風格的能量函式(DOFast)和增強的全域性最佳化器。公司網站稱,其目標是“將學習元件放在能增加價值的地方(提出和排序姿勢),並在需要泛化的地方保留可解釋、低引數的物理模型”。
物理模型的使用使 DODock 能夠基於第一性原理而非先驗資料進行推理,從而在全新靶點上保持準確性,而純 AI 方法在此類情況下會失去精度。Deep Origin 表示,AI 與物理建模的結合是其關鍵差異化因素。將既有的 C++ 和 Fortran 物理引擎移植到 GPU 上也是一項技術挑戰,並非所有公司都能克服。公司對 HPCwire 表示:“構建物理-ML 混合模型需要量子力學、分子動力學力場和可微神經網路架構的深度整合,大多數初創公司缺乏同時掌握兩者的架構和技能。”
Deep Origin 由 Michael Antonov 和 Garegin Papoian 於 2022 年創立,公司表示對 AI 藥物發現採取長期視角。首席科學官 Papoian 表示:“虛擬篩選已廣泛使用超過 40 年,卻很少真正產出藥物。該領域習慣了較低的準確率上限。我們希望通過將物理與機器學習結合來改變這一現狀,確保我們的方法在訓練資料不足的新靶點上仍能保持準確性。”
公司還強調其“零洩漏”資料分割方法。為測試和驗證 AI,Deep Origin 使用“嚴格的雙重相似性過濾器”,移除任何序列同一性超過 30% 的蛋白質,以及 Tanimoto 相似度超過 0.4 的配體。這些方法使公司能夠在沒有現有晶體學資料或已知小分子結合劑的情況下,成功對新型生物靶點進行虛擬篩選。公司聲稱,在純 AI/ML 方法失敗的情況下,其姿態準確率可維持在 50% 至 89%。
這家位於舊金山的公司已融資 8200 萬美元,並在 BioRxiv 上發表了針對包含超過 800 億化合物的合成化合物庫的溼實驗驗證論文。Deep Origin 重點展示了四種化合物的結果,包括 CD73(核苷酸酶)、IRAK4(激酶)、Factor XIa(蛋白酶)和 IL-17A(蛋白質-蛋白質相互作用靶點)。在所有四個靶點上,其命中物表現出高骨架新穎性,ECFP4 Tanimoto 相似度為 0.22–0.27。公司表示,這些篩選發現了全新的化學物質,而非現有藥物的微小變體。
針對 CD73(在減緩癌症生長中起重要作用),Deep Origin 實現了 30.6% 的命中率,約為純 AI/ML 方法的 100 倍。CEO Antonov 表示:“重要的是篩選在尚未被解決的靶點上的表現,因此我們在嚴格分割和設計使其失敗的案例上測試了模型。模型在這些嚴格測試中的表現,而非在虛高的基準上,決定了帶到實驗台上的分子有多少可能是真實的。”