在近期關於模型所有權、開源與閉源、以及主權 AI 的激烈討論中,Poolside AI 的聯合 CEO Eiso Kant 通過一期深度播客訪談,詳細拆解了其團隊如何以極小的規模和驚人的速度,訓練出效能超越近 10 倍規模對手的模型。

Kant 在訪談中透露,Poolside 最新發布的 Laguna S 2.1 模型擁有 118B 總引數,其中僅 8B 引數 在推理時被啟用。該模型在多項基準測試中擊敗了 Thinking Machines 近期釋出的、擁有近 1T 引數 的開放權重模型。這一成果的取得,並非依靠龐大的算力堆砌,而是源於其自建的 「模型工廠」(Model Factory)——一個端到端的系統,能夠將模型從預訓練到釋出的全週期壓縮至 8 周

支撐這一效率的核心是工程創新。Poolside 的團隊規模不到 70 名研究人員,但每月能執行 1 萬至 2 萬次實驗。Kant 強調,模型構建最終 90% 是工程問題。他們通過將資料直接流式傳輸到訓練過程中、使用不可變資料和版本化程式碼確保實驗可復現、以及採用低精度計算來提升效率。這種系統化的實驗流水線,使得團隊能在模型訓練開始後的 30 分鐘內 就對新的檢查點進行初步評估。

Kant 回顧了 Poolside 的創業歷程。早在 2015 年,受 Andrej Karpathy 的 RNN 工作啟發,他就開始為程式碼構建語言模型,並在市場尚未關注前投入了 4 年時間和 1200 萬美元。ChatGPT 的釋出被他視為一種「平反」,並促使 Poolside 迴歸開源路線。他明確表示,寧願生活在一個有 100 家基礎模型公司 的世界,也不願看到只有 5 家寡頭壟斷,即使 Poolside 是那五家之一。

在技術哲學層面,Kant 認為 永續性、驗證和回溯 可能比原始智慧更重要。他指出,較小的模型可能處理的知識工作遠超預期,而 強化學習(RL) 將更早地融入預訓練階段。他批評當前的 MCP(模型上下文協議 和傳統工具呼叫方式「愚蠢」,認為未來的智慧體將直接編寫指令碼,而非從數十個預定義工具中選擇。

關於模型開發的真實成本,Kant 透露,最終的訓練執行往往是「反高潮」的,真正的投入在於前期海量的實驗和工程除錯。Poolside 此前完成了 5 億美元 的融資,當時投資者仍在質疑 AGI 是否真實存在。他預測,智慧可能成為世界上需求最大但也最商品化的資源。

訪談還涉及了開源 AI 的監管問題。Kant 警告,單方面的 AI 安全措施在全球化競爭環境中難以奏效,而不當的監管可能意外地鎖定一個由兩三家 AI 公司組成的寡頭壟斷格局。他同時承認,輝達(NVIDIA)台積電(TSMC) 的硬體系統是基礎模型進步的關鍵支撐。