Google DeepMind 发布了一个名为 AlphaGenome Atlas 的大型数据集,把人类基因组中超过 90 亿种可能的单字母变异(单碱基变化)的分子效应预测提前算好,供研究者直接检索。数据集规模约 1PB,由 DeepMind 的 AlphaGenome 模型生成。
90 亿这个数字来自简单算术:人类基因组约有 30 亿个 DNA 字母,字母只有 A、C、G、T 四种,任一位置的字母都可能被替换成另外三种,于是组合出约 90 亿种单碱基变化。研究者关心这些变异,是因为其中一部分会影响基因工作方式并参与疾病发生,难点在于把真正重要的变化从大量影响微弱的变化中挑出来——尤其是占基因组约 98%、不直接编码蛋白质的那部分。
AlphaGenome 模型负责预测遗传变化如何影响基因表达、RNA 剪接、染色质可及性等分子过程。Atlas 的价值在于把这些预测在全基因组范围内预先计算,而不是让研究者每次研究一个变异就重新跑一遍模型。DeepMind 表示,Atlas 不只是给 90 亿种变化各配一个答案,而是为每个变异提供数千条分子效应预测,覆盖数百种人类与小鼠细胞类型及组织。
规模之外,如何从海量预测中筛出值得关注的变异同样是挑战。为此 DeepMind 推出 AlphaGenome Variant Impact(AVI)评分,把 AlphaGenome 与用于预测改变蛋白质的 DNA 变异影响的 AlphaMissense 两个模型的预测合并为单一数值,研究者可据此对变异按潜在影响排序。该评分同时适用于编码蛋白质的 2% 基因组和其余 98% 非编码区域,Atlas 还会显示某个变异预计影响哪些分子过程,例如 RNA 剪接或基因表达。
已有研究团队开始使用这一资源。DeepMind 在发布博客中提到,埃克塞特大学医学研究理事会研究员 Gareth Hawkes 将 Atlas 应用于 UK Biobank 逾 5.4 万名参与者的全基因组数据,通过按预测分子效应分组罕见变异,发现了多出 22% 的非编码遗传关联,这些信号原本会淹没在统计噪声中。在罕见病方向,Broad Institute 的研究者与 GREGoR 联盟合作,用 AVI 评分寻找此前研究遗漏的变异,识别出一个影响 DNM1 基因的变异——该基因与癫痫性脑病密切相关。AlphaGenome 预测该变异制造了错误的 RNA 剪接位点,后续实验验证了这一预测。
目前 Atlas 通过网站和 AlphaGenome API 对研究者免费开放,DeepMind 称通过 Google Cloud 的商业访问即将推出。公司同时强调这只是起点:随着 AlphaGenome 及其他 AI 模型迭代,Atlas 也会更新。它不会直接告诉研究者哪些遗传变化导致疾病,但能帮助判断哪些变异值得投入更多时间与实验验证。
从产业视角看,这条消息的意义不止于一个数据库。它显示前沿 AI 模型正从「按需调用的工具」转向「预先算好的科研基础设施」——把昂贵推理一次性完成、再以检索和评分的形式交付,既降低了生命科学研究的算力门槛,也为云厂商在科研场景中的商业化打开空间。对关注 AI 产业链的读者而言,这类「模型 + 大规模预计算 + 云分发」的模式,可能成为 AI 在垂直科学领域落地的一种常见形态。