AI 推理云服务商 Gimlet Labs 完成了一轮 3 亿美元融资,由 Andreessen Horowitz 领投,公司估值达到 30 亿美元。这家公司成立于 2023 年,源自 CEO Zain Asgar 在斯坦福大学的研究项目,核心思路是用软件把 AI 推理任务路由到最合适的硬件上执行。
联合创始人 Natalie Serrino 在接受 HPCwire 采访时表示,公司从创立之初就认为可以把推理效率提升若干个数量级,因此希望从底层重新思考整个技术栈——如果推理将成为主导性的软件负载,那么基础设施和软件就应该围绕它来组织,以实现尽可能高的效率。
Gimlet Labs 的做法是在多种硬件之上架设一层软件编排层,把 AI 工作负载切片并分发到不同芯片上执行。例如,AI 推理的 prefill 阶段可以借助大型 GPU 的算力来完成,而 decode 阶段则更适合交给具备极高内存带宽的 SRAM 优化芯片。为此,公司开发了多个软件项目,包括负责调度、编排与优化的核心平台 Gimlet Cloud,以及能从 PyTorch 直接生成优化底层内核的 kforge。此外还涉及通用 AI 编译器、工作负载分区、SLA 感知调度、无头硬件架构、预测性优化和内核融合等方向。
不过,纯软件路线后来被证明有其边界。Serrino 表示,要彻底解决问题,公司需要自行设计并管理整个数据中心。她指出,当前行业普遍受制于电力,在有限的电力预算内尽可能榨取性能与效率变得更为关键,而从底层做全栈优化是实现这一目标的最佳方式。
在芯片选择上,Gimlet Labs 并不追求把市面上所有芯片都塞进数据中心。Serrino 说,一个数据中心里放 20 种不同芯片在运营上会是噩梦,公司希望每个数据中心只使用 2 到 4 种芯片,形成可重复的标准化配置,各自发挥所长。Gimlet 把芯片分为四大类:GPU、CPU、SRAM 芯片,以及数据流加速器和 TPU。其数据中心采用的芯片来自 Nvidia、AMD、Intel、Arm、d-Matrix 和 Cerebras。
部署时,Gimlet Labs 采取配对策略:通常以一颗 GPU 作为配对基础,再选择另一颗芯片与之搭配。Serrino 表示,以 GPU 为中心的芯片配对在获得显著加速的同时,能保持与纯 GPU 部署相近的效率。公司并不要求每颗芯片样样精通,而是寻找每颗芯片真正突出的强项。每颗芯片都有各自的取舍,Gimlet 会依据这种取舍曲线,挑选最匹配工作负载的芯片组合,以在最优能耗水平下取得最佳性能。
她举例说,需要大量内存带宽时用其中一颗芯片,需要大量算力来吞吐计算时用另一颗,GPU 与 SRAM 芯片的配对在此表现良好。
值得注意的是,Nvidia 过去几年也在构建成对的超级芯片,从 Grace Hopper 超级芯片(将两颗 Hopper GPU 与一颗基于 Arm 的 Grace 芯片配对)开始,并延续到 Vera Rubin 芯片。区别在于,Gimlet Labs 是在数据中心层面做这件事,并且针对特定的 AI 工作负载。
把不同芯片在物理层面集成起来并不总是容易。Serrino 提到,它们可能有完全不同的网络连接和散热需求,例如不同芯片对液冷温度的要求可能不同,要在同一个数据中心里同时冷却它们,需要 Gimlet Labs 在硬件工程上投入。拆分方式以及是否跨多个数据中心进行拆分,也会影响网络。她提到,中国 AI 公司 Moonshot AI 近期的一篇论文展示了数据中心级拆分的潜力,其 Kimi K3 模型即是一例。
从产业视角看,Gimlet Labs 的路线反映了 AI 推理时代的一个核心矛盾:算力需求持续膨胀,而电力与芯片供给相对受限。通过软件编排把不同芯片的长处组合起来,理论上可以在不单纯堆叠 GPU 的前提下提升单位电力的推理产出。这一思路能否在规模化运营中兑现效率承诺,将影响 neocloud 赛道其他玩家对硬件选型与数据中心架构的判断,也会牵动 GPU 之外 SRAM 芯片、数据流加速器等细分芯片厂商在推理市场中的位置。