总部位于伦敦的 Basecamp Research 完成 1.4 亿美元融资,投资方包括 英伟达、Anthropic 的 Anthology Fund、北约创新基金(NATO Innovation Fund)和 Redalpine 等,本轮由 S32 领投。公司成立于 2020 年,计划把这笔资金用于继续开发其名为 EDEN 的生物 AI 模型,并推动自有疗法候选药物进入临床开发阶段,其中细胞疗法被排在优先位置。
Basecamp 的思路与主流大模型不同:它不训练语言,而是训练 DNA。公司从全球各地的环境样本中采集微生物遗传物质——雨林土壤、火山地热区、南极深海都在采样范围内——再让模型从这些基因组中学习可被医学利用的规律。据公司介绍,其采样网络已覆盖 30 多个国家和全部七大洲;微软给出的数字是 31 个国家、208 家参与机构。
细胞疗法是 Basecamp 最先瞄准的方向。这类疗法通常需要把患者的细胞取出、在体外做基因改造后再回输,使其能够对抗癌症等疾病;Basecamp 想做的,是直接在体内完成这种基因修改。为此,公司还在设计能够把基因插入体内特定位置的生物工具,并开发针对多重耐药菌的新型抗生素。
目前这些候选药物只在实验室和小鼠身上显示出效果。公司自己也承认,人体临床试验尚未开展,疗法是否安全有效仍需验证。这意味着从现有数据到真正可用的治疗手段之间,还有相当长的开发路程。
Basecamp 首席技术官 Philip Lorenz 在接受 THE DECODER 采访时,把生物学描述为比语言「复杂得多、也庞大得多」的问题。他用 Epoch AI 的一个估算来说明差距:人类现有全部文字的上限大约是 5000 万亿(5 quadrillion)个 token,而 Basecamp 估计地球上的核苷酸数量约为 10 的 37 次方。Lorenz 打了个比方:如果把 10 的 37 次方张扑克牌叠起来,这摞牌能绕可观测宇宙一百万圈。他强调并不需要那么大的数据集,但确实需要比今天大得多的数据规模。
在他看来,真正的关键不只是数据量,而是把大规模采集与规模较小、目标明确的实验配对起来。生物学与语言模型还有一个根本差异:语言模型从海量文本中学习,而制药公司往往只能使用来自单项研究的、彼此孤立的小数据集。
公共基因组数据库的偏向性也被 Basecamp 视为瓶颈。根据该公司关于其 BaseData 数据库的研究论文,Sequence Read Archive 中约 68% 的序列量只来自 5 个物种,其中人类一种就占约 54%。对医学研究而言这种集中有其道理,但对一个想学习尽可能多生物过程的模型来说,大量其他生命形式几乎不在数据里。Lorenz 用微软案例研究中的比喻说,如果只用 1975 年的报纸文章训练大语言模型,得到的会是一个非常糟糕的模型,而生物学目前大致就处在这个阶段。
数据规模上,Lorenz 在采访期间表示数据集约有 15 万亿 token,已经接近训练 Claude 或 GPT 这类模型所用的文本数据集量级。区别在于,这里的每个 token 是一个 DNA 构建单元,模型处理的是描述遗传物质的字符串,而不是聊天机器人式的词语。据微软披露,第一代 EDEN 在 Azure 上训练,使用了来自 100 多万个新测序物种的 9.7 万亿个 DNA 构建单元,算力据称与 GPT-4 相当——不过 OpenAI 从未正式公布过这一数字。
公司计划在未来约一年半内把数据集扩大约 100 倍,突破 1000 万亿(1 quadrillion)token。支撑这一目标的是 3 月宣布的 Trillion Gene Atlas 计划,Basecamp 与 Anthropic、英伟达、PacBio、Ultima Genomics 将合作汇集规模达 1 万亿个基因的遗传数据。在最新一轮融资公告中,Basecamp 已把 Trillion Gene Atlas 称为其模型的训练基础。
值得注意的是,生物 AI 的证据基础仍不牢固。《华尔街日报》近期报道称,制药公司正投入数十亿美元于 AI,但临床开发成功率明显提升的确凿证据依然稀少。Lorenz 不认为这构成怀疑技术的理由:语言模型在扩展规模后很快取得大幅进步,生物学也在推进,只是像加快临床试验这类核心难题要难得多。对关注 AI 产业的人而言,这条新闻的意义或许正在于此——资本与算力正流向数据更稀缺、验证周期更长的领域,而模型在纸面上的高分,并不自动等于能造出可用的分子。