Anthropic 于 8 月 19 日发布两项实验报告,展示了其 Claude 模型在早期药物研发中的自主蛋白质设计能力。在针对 16 个靶点蛋白的测试中,Claude 成功为其中 14 个靶点设计出能与之结合的小蛋白(称为 minibinder),命中率远超行业平均水平。这一结果若经独立验证,可能为 AI 驱动的药物发现开辟新路径。
在第一项实验中,Anthropic 使用 Claude 的 Mythos Preview 和 Opus 4.8 模型,针对 16 个靶点蛋白进行从头设计。在 15 个产生可用测量的靶点中,Claude 成功攻克了 14 个。实验室测试显示,在 1320 个设计中,有 354 个成功与靶点结合,命中率为 26.8%;若仅看 Claude 自评排名第一的设计,命中率高达 49%。在多靶点并行模式下(48 小时内处理所有靶点),Mythos Preview 和 Opus 4.8 的命中率分别为 26.7% 和 22.6%。当 Mythos Preview 单独处理每个靶点时,命中率提升至 35.1%,但每个靶点的计算预算增加了 2.8 倍。作为对比,Anthropic 引用 proteinbase.com 数据库中的公开数据,指出现有方法的典型命中率仅为 10-15%。
值得注意的是,Anthropic 并未自研蛋白质模型,而是让 Claude 调用现有开源工具完成整个流程。蛋白质骨架由 PXDesign、RFdiffusion3、Genie 3 等工具生成,氨基酸序列主要由 SolubleMPNN 计算,候选设计则通过 ESMFold2、Protenix v2 等工具进行筛选和排序。由于许可限制,AlphaFold-3 权重、Rosetta 和 ESM3 未被使用。整个系统由约 16000 字的协议提示词驱动,其中仅三分之一为科学指导,其余部分涉及任务调度、子代理委派和预算控制。实验通过云服务商 Modal 运行,多靶点活动预算为 5 万美元,单靶点为 1 万美元。人类仅负责选择靶点、编写提示词、订购合成和解读数据,过程中仅在基础设施中断时提供简短的非技术性指令。
实验的验证环节由付费合同实验室 Adaptyv Bio 和 Twist Bioscience 完成,它们独立生产并测试了每个设计是否与靶点结合及其结合强度(以 KD 值衡量)。结果因靶点而异:针对免疫受体 TREM2,90 个设计中有 72 个成功结合;针对生长因子 VEGF-A,90 个中有 54 个成功。最引人注目的案例是 RBX1——一个参与细胞内蛋白质降解的酶复合物组分。在公开设计竞赛中,245 个新设计仅有 9 个能与之结合,而 Claude 的 90 个设计中就有 28 个成功。Anthropic 还让竞赛获胜设计在同一测定板上复测,其结合强度为 45 nM,而 Claude 的最佳设计为 3.9 nM,紧密约十倍。
对于公认困难的靶点 TNFα(一种引发炎症的免疫信号分子,已有五种获批生物药靶向它),此前多种设计方法均报告零命中,而 Claude 在 150 个设计中产生了 12 个结合物,全部来自 Opus 4.8。不过,这些结合物仅源自四种不同的骨架,多样性有限。此外,在 233 个测试的结合物中,有 130 个也能与小鼠版本的靶点结合,这对后续动物实验具有实际意义。
实验也揭示了 Claude 的局限。针对计算机发明的桶状蛋白 BBF-14(自然界不存在,无进化历史可循),仅 3 个弱结合设计成功;针对细菌麦芽糖结合蛋白 MBP(表面光滑亲水,难以结合),90 个设计全部失败。Anthropic 指出,折叠预测的置信度评分未能预警这些失败——失败靶点的得分与成功靶点几乎相同。
在第二项实验中,Opus 5 模型被用于解读合同实验室的核磁共振波谱(NMR)等原始数据,在不到 25 分钟内完成化学分析。Anthropic 表示,这些结果仍需独立评审,目前尚未经过同行评议。若后续验证成立,这一进展可能意味着,任何实验室都能借助大语言模型,以更低成本和更高效率开展蛋白质设计,从而加速早期药物发现进程。