AI 推理雲服務商 Gimlet Labs 完成了一輪 3 億美元融資,由 Andreessen Horowitz 領投,公司估值達到 30 億美元。這家公司成立於 2023 年,源自 CEO Zain Asgar 在斯坦福大學的研究專案,核心思路是用軟體把 AI 推理任務路由到最合適的硬體上執行。

聯合創始人 Natalie Serrino 在接受 HPCwire 採訪時表示,公司從創立之初就認為可以把推理效率提升若干個數量級,因此希望從底層重新思考整個技術棧——如果推理將成為主導性的軟體負載,那麼基礎設施和軟體就應該圍繞它來組織,以實現儘可能高的效率。

Gimlet Labs 的做法是在多種硬體之上架設一層軟體編排層,把 AI 工作負載切片並分發到不同晶片上執行。例如,AI 推理的 prefill 階段可以藉助大型 GPU 的算力來完成,而 decode 階段則更適合交給具備極高記憶體頻寬的 SRAM 最佳化晶片。為此,公司開發了多個軟體專案,包括負責排程、編排與最佳化的核心平台 Gimlet Cloud,以及能從 PyTorch 直接生成最佳化底層核心的 kforge。此外還涉及通用 AI 編譯器、工作負載分割槽、SLA 感知排程、無頭硬體架構、預測性最佳化和核心融合等方向。

不過,純軟體路線後來被證明有其邊界。Serrino 表示,要徹底解決問題,公司需要自行設計並管理整個資料中心。她指出,當前行業普遍受制於電力,在有限的電力預算內儘可能榨取效能與效率變得更為關鍵,而從底層做全棧最佳化是實現這一目標的最佳方式。

在晶片選擇上,Gimlet Labs 並不追求把市面上所有晶片都塞進資料中心。Serrino 說,一個數據中心裡放 20 種不同晶片在運營上會是噩夢,公司希望每個資料中心只使用 2 到 4 種晶片,形成可重複的標準化配置,各自發揮所長。Gimlet 把晶片分為四大類:GPU、CPU、SRAM 晶片,以及資料流加速器和 TPU。其資料中心採用的晶片來自 Nvidia、AMD、Intel、Arm、d-Matrix 和 Cerebras

部署時,Gimlet Labs 採取配對策略:通常以一顆 GPU 作為配對基礎,再選擇另一顆晶片與之搭配。Serrino 表示,以 GPU 為中心的晶片配對在獲得顯著加速的同時,能保持與純 GPU 部署相近的效率。公司並不要求每顆晶片樣樣精通,而是尋找每顆晶片真正突出的強項。每顆晶片都有各自的取捨,Gimlet 會依據這種取捨曲線,挑選最匹配工作負載的晶片組合,以在最優能耗水平下取得最佳效能。

她舉例說,需要大量記憶體頻寬時用其中一顆晶片,需要大量算力來吞吐計算時用另一顆,GPU 與 SRAM 晶片的配對在此表現良好。

值得注意的是,Nvidia 過去幾年也在構建成對的超級晶片,從 Grace Hopper 超級晶片(將兩顆 Hopper GPU 與一顆基於 Arm 的 Grace 晶片配對)開始,並延續到 Vera Rubin 晶片。區別在於,Gimlet Labs 是在資料中心層面做這件事,並且針對特定的 AI 工作負載。

把不同晶片在物理層面整合起來並不總是容易。Serrino 提到,它們可能有完全不同的網路連線和散熱需求,例如不同晶片對液冷溫度的要求可能不同,要在同一個資料中心裡同時冷卻它們,需要 Gimlet Labs 在硬體工程上投入。拆分方式以及是否跨多個數據中心進行拆分,也會影響網路。她提到,中國 AI 公司 Moonshot AI 近期的一篇論文展示了資料中心級拆分的潛力,其 Kimi K3 模型即是一例。

從產業視角看,Gimlet Labs 的路線反映了 AI 推理時代的一個核心矛盾:算力需求持續膨脹,而電力與晶片供給相對受限。通過軟體編排把不同晶片的長處組合起來,理論上可以在不單純堆疊 GPU 的前提下提升單位電力的推理產出。這一思路能否在規模化運營中兌現效率承諾,將影響 neocloud 賽道其他玩家對硬體選型與資料中心架構的判斷,也會牽動 GPU 之外 SRAM 晶片、資料流加速器等細分晶片廠商在推理市場中的位置。