由馬克·扎克伯格與普莉希拉·陳支援的非營利研究機構Biohub,正在協調一項總額18億美元的計劃,目標是訓練出能夠預測細胞行為的AI模型。據路透社報道,這筆資金橫跨資料、實驗室裝置與算力三個方向,而非單純投向模型訓練本身。

資金結構上,Biohub此前已在今年4月為其五年期「虛擬生物學計劃」承諾5億美元。Meta、Google DeepMind與Isomorphic Labs三家合計出資3億美元;美國能源部則將在五年內投入超過5億美元,用於實驗室測量與算力。美國國立衛生研究院負責協調資料集,這些資料集由此前超過5億美元的聯邦資金建成,Biohub將把它們標準化,以便用於AI訓練。

資料開放規則是這項計劃中較受關注的一環。據Biohub研究負責人Alex Rives介紹,商業出資方對其付費產生的資料享有一年獨家使用權,之後資料才會公開;由政府資金支援的工作則不受這一限制,可直接開放。首批資料集預計約一年後準備就緒。

把細胞行為變成可預測的物件,是這項計劃的核心命題。傳統藥物研發依賴大量試錯,若模型能在計算機中預判細胞對藥物或基因擾動的反應,早期篩選與靶點驗證的週期和成本都有望壓縮。但這類模型高度依賴高質量的實驗測量資料——這正是能源部與國立衛生研究院角色吃重的原因:算力可以採購,標準化、可復現的生物學資料卻需要長期積累。

從產業格局看,這並非孤例。Anthropic已自建生物學實驗室,用於AI驅動的藥物研發;OpenAI Foundation也正投入超過1.25億美元用於生物與醫學資料集。幾家頭部AI機構幾乎同時向生命科學傾斜,說明該領域正被視為繼語言、程式碼、影像之後的下一個高價值應用方向。

對關注AI產業的投資者而言,這條訊息的意義在於它展示了一種新的協作範式:非營利機構做協調者,商業AI公司出資金與模型能力,政府實驗室與公共資金提供測量與資料底座。這種組合能否產出可複用的模型與資料資產,將影響未來生物醫藥領域AI工具的競爭門檻,也會牽動算力需求與資料授權模式在垂直行業的落地方式。

需要留意的是,資料獨家訪問期的安排,實際上在公共資金與商業資金之間劃出了一條界線:政府資助成果開放,商業出資成果先內部使用一年。這一設計既為商業方保留了投入回報的視窗,也可能在未來引發關於生物資料公平獲取的討論。首批資料集一年後能否如期交付、標準化程度如何,將是觀察該計劃實際進展的第一個節點。