由马克·扎克伯格与普莉希拉·陈支持的非营利研究机构Biohub,正在协调一项总额18亿美元的计划,目标是训练出能够预测细胞行为的AI模型。据路透社报道,这笔资金横跨数据、实验室设备与算力三个方向,而非单纯投向模型训练本身。
资金结构上,Biohub此前已在今年4月为其五年期「虚拟生物学计划」承诺5亿美元。Meta、Google DeepMind与Isomorphic Labs三家合计出资3亿美元;美国能源部则将在五年内投入超过5亿美元,用于实验室测量与算力。美国国立卫生研究院负责协调数据集,这些数据集由此前超过5亿美元的联邦资金建成,Biohub将把它们标准化,以便用于AI训练。
数据开放规则是这项计划中较受关注的一环。据Biohub研究负责人Alex Rives介绍,商业出资方对其付费产生的数据享有一年独家使用权,之后数据才会公开;由政府资金支持的工作则不受这一限制,可直接开放。首批数据集预计约一年后准备就绪。
把细胞行为变成可预测的对象,是这项计划的核心命题。传统药物研发依赖大量试错,若模型能在计算机中预判细胞对药物或基因扰动的反应,早期筛选与靶点验证的周期和成本都有望压缩。但这类模型高度依赖高质量的实验测量数据——这正是能源部与国立卫生研究院角色吃重的原因:算力可以采购,标准化、可复现的生物学数据却需要长期积累。
从产业格局看,这并非孤例。Anthropic已自建生物学实验室,用于AI驱动的药物研发;OpenAI Foundation也正投入超过1.25亿美元用于生物与医学数据集。几家头部AI机构几乎同时向生命科学倾斜,说明该领域正被视为继语言、代码、图像之后的下一个高价值应用方向。
对关注AI产业的投资者而言,这条消息的意义在于它展示了一种新的协作范式:非营利机构做协调者,商业AI公司出资金与模型能力,政府实验室与公共资金提供测量与数据底座。这种组合能否产出可复用的模型与数据资产,将影响未来生物医药领域AI工具的竞争门槛,也会牵动算力需求与数据授权模式在垂直行业的落地方式。
需要留意的是,数据独家访问期的安排,实际上在公共资金与商业资金之间划出了一条界线:政府资助成果开放,商业出资成果先内部使用一年。这一设计既为商业方保留了投入回报的窗口,也可能在未来引发关于生物数据公平获取的讨论。首批数据集一年后能否如期交付、标准化程度如何,将是观察该计划实际进展的第一个节点。