Anthropic 於 8 月 19 日釋出兩項實驗報告,展示了其 Claude 模型在早期藥物研發中的自主蛋白質設計能力。在針對 16 個靶點蛋白的測試中,Claude 成功為其中 14 個靶點設計出能與之結合的小蛋白(稱為 minibinder),命中率遠超行業平均水平。這一結果若經獨立驗證,可能為 AI 驅動的藥物發現開闢新路徑。
在第一項實驗中,Anthropic 使用 Claude 的 Mythos Preview 和 Opus 4.8 模型,針對 16 個靶點蛋白進行從頭設計。在 15 個產生可用測量的靶點中,Claude 成功攻克了 14 個。實驗室測試顯示,在 1320 個設計中,有 354 個成功與靶點結合,命中率為 26.8%;若僅看 Claude 自評排名第一的設計,命中率高達 49%。在多靶點並行模式下(48 小時內處理所有靶點),Mythos Preview 和 Opus 4.8 的命中率分別為 26.7% 和 22.6%。當 Mythos Preview 單獨處理每個靶點時,命中率提升至 35.1%,但每個靶點的計算預算增加了 2.8 倍。作為對比,Anthropic 引用 proteinbase.com 資料庫中的公開資料,指出現有方法的典型命中率僅為 10-15%。
值得注意的是,Anthropic 並未自研蛋白質模型,而是讓 Claude 呼叫現有開源工具完成整個流程。蛋白質骨架由 PXDesign、RFdiffusion3、Genie 3 等工具生成,氨基酸序列主要由 SolubleMPNN 計算,候選設計則通過 ESMFold2、Protenix v2 等工具進行篩選和排序。由於許可限制,AlphaFold-3 權重、Rosetta 和 ESM3 未被使用。整個系統由約 16000 字的協議提示詞驅動,其中僅三分之一為科學指導,其餘部分涉及任務排程、子代理委派和預算控制。實驗通過雲服務商 Modal 執行,多靶點活動預算為 5 萬美元,單靶點為 1 萬美元。人類僅負責選擇靶點、編寫提示詞、訂購合成和解讀資料,過程中僅在基礎設施中斷時提供簡短的非技術性指令。
實驗的驗證環節由付費合同實驗室 Adaptyv Bio 和 Twist Bioscience 完成,它們獨立生產並測試了每個設計是否與靶點結合及其結合強度(以 KD 值衡量)。結果因靶點而異:針對免疫受體 TREM2,90 個設計中有 72 個成功結合;針對生長因子 VEGF-A,90 箇中有 54 個成功。最引人注目的案例是 RBX1——一個參與細胞內蛋白質降解的酶複合物組分。在公開設計競賽中,245 個新設計僅有 9 個能與之結合,而 Claude 的 90 個設計中就有 28 個成功。Anthropic 還讓競賽獲勝設計在同一測定板上覆測,其結合強度為 45 nM,而 Claude 的最佳設計為 3.9 nM,緊密約十倍。
對於公認困難的靶點 TNFα(一種引發炎症的免疫訊號分子,已有五種獲批生物藥靶向它),此前多種設計方法均報告零命中,而 Claude 在 150 個設計中產生了 12 個結合物,全部來自 Opus 4.8。不過,這些結合物僅源自四種不同的骨架,多樣性有限。此外,在 233 個測試的結合物中,有 130 個也能與小鼠版本的靶點結合,這對後續動物實驗具有實際意義。
實驗也揭示了 Claude 的侷限。針對計算機發明的桶狀蛋白 BBF-14(自然界不存在,無進化歷史可循),僅 3 個弱結合設計成功;針對細菌麥芽糖結合蛋白 MBP(表面光滑親水,難以結合),90 個設計全部失敗。Anthropic 指出,摺疊預測的置信度評分未能預警這些失敗——失敗靶點的得分與成功靶點幾乎相同。
在第二項實驗中,Opus 5 模型被用於解讀合同實驗室的核磁共振波譜(NMR)等原始資料,在不到 25 分鐘內完成化學分析。Anthropic 表示,這些結果仍需獨立評審,目前尚未經過同行評議。若後續驗證成立,這一進展可能意味著,任何實驗室都能借助大語言模型,以更低成本和更高效率開展蛋白質設計,從而加速早期藥物發現程序。