Google DeepMind 釋出了一個名為 AlphaGenome Atlas 的大型資料集,把人類基因組中超過 90 億種可能的單字母變異(單鹼基變化)的分子效應預測提前算好,供研究者直接檢索。資料集規模約 1PB,由 DeepMind 的 AlphaGenome 模型生成。

90 億這個數字來自簡單算術:人類基因組約有 30 億個 DNA 字母,字母只有 A、C、G、T 四種,任一位置的字母都可能被替換成另外三種,於是組合出約 90 億種單鹼基變化。研究者關心這些變異,是因為其中一部分會影響基因工作方式並參與疾病發生,難點在於把真正重要的變化從大量影響微弱的變化中挑出來——尤其是佔基因組約 98%、不直接編碼蛋白質的那部分。

AlphaGenome 模型負責預測遺傳變化如何影響基因表達、RNA 剪接、染色質可及性等分子過程。Atlas 的價值在於把這些預測在全基因組範圍內預先計算,而不是讓研究者每次研究一個變異就重新跑一遍模型。DeepMind 表示,Atlas 不只是給 90 億種變化各配一個答案,而是為每個變異提供數千條分子效應預測,覆蓋數百種人類與小鼠細胞型別及組織。

規模之外,如何從海量預測中篩出值得關注的變異同樣是挑戰。為此 DeepMind 推出 AlphaGenome Variant Impact(AVI)評分,把 AlphaGenome 與用於預測改變蛋白質的 DNA 變異影響的 AlphaMissense 兩個模型的預測合併為單一數值,研究者可據此對變異按潛在影響排序。該評分同時適用於編碼蛋白質的 2% 基因組和其餘 98% 非編碼區域,Atlas 還會顯示某個變異預計影響哪些分子過程,例如 RNA 剪接或基因表達。

已有研究團隊開始使用這一資源。DeepMind 在釋出部落格中提到,埃克塞特大學醫學研究理事會研究員 Gareth Hawkes 將 Atlas 應用於 UK Biobank5.4 萬名參與者的全基因組資料,通過按預測分子效應分組罕見變異,發現了多出 22% 的非編碼遺傳關聯,這些訊號原本會淹沒在統計噪聲中。在罕見病方向,Broad Institute 的研究者與 GREGoR 聯盟合作,用 AVI 評分尋找此前研究遺漏的變異,識別出一個影響 DNM1 基因的變異——該基因與癲癇性腦病密切相關。AlphaGenome 預測該變異製造了錯誤的 RNA 剪接位點,後續實驗驗證了這一預測。

目前 Atlas 通過網站和 AlphaGenome API 對研究者免費開放,DeepMind 稱通過 Google Cloud 的商業訪問即將推出。公司同時強調這只是起點:隨著 AlphaGenome 及其他 AI 模型迭代,Atlas 也會更新。它不會直接告訴研究者哪些遺傳變化導致疾病,但能幫助判斷哪些變異值得投入更多時間與實驗驗證。

從產業視角看,這條訊息的意義不止於一個數據庫。它顯示前沿 AI 模型正從「按需呼叫的工具」轉向「預先算好的科研基礎設施」——把昂貴推理一次性完成、再以檢索和評分的形式交付,既降低了生命科學研究的算力門檻,也為雲廠商在科研場景中的商業化開啟空間。對關注 AI 產業鏈的讀者而言,這類「模型 + 大規模預計算 + 雲分發」的模式,可能成為 AI 在垂直科學領域落地的一種常見形態。