總部位於倫敦的 Basecamp Research 完成 1.4 億美元融資,投資方包括 輝達、Anthropic 的 Anthology Fund、北約創新基金(NATO Innovation Fund)和 Redalpine 等,本輪由 S32 領投。公司成立於 2020 年,計劃把這筆資金用於繼續開發其名為 EDEN 的生物 AI 模型,並推動自有療法候選藥物進入臨床開發階段,其中細胞療法被排在優先位置。
Basecamp 的思路與主流大模型不同:它不訓練語言,而是訓練 DNA。公司從全球各地的環境樣本中採集微生物遺傳物質——雨林土壤、火山地熱區、南極深海都在取樣範圍內——再讓模型從這些基因組中學習可被醫學利用的規律。據公司介紹,其取樣網路已覆蓋 30 多個國家和全部七大洲;微軟給出的數字是 31 個國家、208 家參與機構。
細胞療法是 Basecamp 最先瞄準的方向。這類療法通常需要把患者的細胞取出、在體外做基因改造後再回輸,使其能夠對抗癌症等疾病;Basecamp 想做的,是直接在體內完成這種基因修改。為此,公司還在設計能夠把基因插入體內特定位置的生物工具,並開發針對多重耐藥菌的新型抗生素。
目前這些候選藥物只在實驗室和小鼠身上顯示出效果。公司自己也承認,人體臨床試驗尚未開展,療法是否安全有效仍需驗證。這意味著從現有資料到真正可用的治療手段之間,還有相當長的開發路程。
Basecamp 技術長 Philip Lorenz 在接受 THE DECODER 採訪時,把生物學描述為比語言「複雜得多、也龐大得多」的問題。他用 Epoch AI 的一個估算來說明差距:人類現有全部文字的上限大約是 5000 萬億(5 quadrillion)個 token,而 Basecamp 估計地球上的核苷酸數量約為 10 的 37 次方。Lorenz 打了個比方:如果把 10 的 37 次方張撲克牌疊起來,這摞牌能繞可觀測宇宙一百萬圈。他強調並不需要那麼大的資料集,但確實需要比今天大得多的資料規模。
在他看來,真正的關鍵不只是資料量,而是把大規模採集與規模較小、目標明確的實驗配對起來。生物學與語言模型還有一個根本差異:語言模型從海量文本中學習,而製藥公司往往只能使用來自單項研究的、彼此孤立的小資料集。
公共基因組資料庫的偏向性也被 Basecamp 視為瓶頸。根據該公司關於其 BaseData 資料庫的研究論文,Sequence Read Archive 中約 68% 的序列量只來自 5 個物種,其中人類一種就佔約 54%。對醫學研究而言這種集中有其道理,但對一個想學習儘可能多生物過程的模型來說,大量其他生命形式幾乎不在資料裡。Lorenz 用微軟案例研究中的比喻說,如果只用 1975 年的報紙文章訓練大語言模型,得到的會是一個非常糟糕的模型,而生物學目前大致就處在這個階段。
資料規模上,Lorenz 在採訪期間表示資料集約有 15 萬億 token,已經接近訓練 Claude 或 GPT 這類模型所用的文本資料集量級。區別在於,這裡的每個 token 是一個 DNA 構建單元,模型處理的是描述遺傳物質的字串,而不是聊天機器人式的詞語。據微軟披露,第一代 EDEN 在 Azure 上訓練,使用了來自 100 多萬個新測序物種的 9.7 萬億個 DNA 構建單元,算力據稱與 GPT-4 相當——不過 OpenAI 從未正式公佈過這一數字。
公司計劃在未來約一年半內把資料集擴大約 100 倍,突破 1000 萬億(1 quadrillion)token。支撐這一目標的是 3 月宣佈的 Trillion Gene Atlas 計劃,Basecamp 與 Anthropic、輝達、PacBio、Ultima Genomics 將合作彙集規模達 1 萬億個基因的遺傳資料。在最新一輪融資公告中,Basecamp 已把 Trillion Gene Atlas 稱為其模型的訓練基礎。
值得注意的是,生物 AI 的證據基礎仍不牢固。《華爾街日報》近期報道稱,製藥公司正投入數十億美元於 AI,但臨床開發成功率明顯提升的確鑿證據依然稀少。Lorenz 不認為這構成懷疑技術的理由:語言模型在擴充套件規模後很快取得大幅進步,生物學也在推進,只是像加快臨床試驗這類核心難題要難得多。對關注 AI 產業的人而言,這條新聞的意義或許正在於此——資本與算力正流向資料更稀缺、驗證週期更長的領域,而模型在紙面上的高分,並不自動等於能造出可用的分子。