英伟达周一宣布,其 Groq 3 LPX 机架已全面投产,这是该公司史上最大收购——以 200 亿美元收购芯片初创公司 Groq 资产——所获技术的商业化里程碑。英伟达高级总监 Dion Harris 向记者表示,该机架将部署在 neocloud 服务商 Nebius 的数据中心,与 Vera 中央处理器和 Rubin 图形处理器搭配使用,并将在今年晚些时候上线。

英伟达急于将 Groq 芯片量产并交付客户,凸显了低延迟推理在 AI 领域日益增长的重要性。低延迟推理能让 AI 智能体在用户交互时几乎无延迟响应,尤其对编程等场景至关重要。英伟达表示,云服务商可以为此类 token 收取更高费用。Harris 在电话会议中称,对于提供 token 服务的厂商而言,这解锁了为那些对延迟敏感的服务协议要求最高的用户和客户提供高级服务层级的能力。

去年 12 月,英伟达以 200 亿美元从芯片初创公司 Groq 手中收购资产,这是该公司历史上最大的一笔收购。Groq 架构在芯片裸片上集成了 500 兆字节的高速 SRAM,以减少内存相关的瓶颈。Groq 芯片由三星代工,而英伟达的 GPU 则由台积电制造。英伟达将 256 个 Groq 3 芯片封装进其 LPX 机架中。英伟达援引 Artificial Analysis 的基准测试称,其 Groq 3 LPX 机架每秒可处理 3400 个 token。

这一领域竞争激烈。较小的 GPU 制造商 AMD 今年早些时候宣布,将把其机架级系统与 Cerebras 的芯片集成,专注于低延迟推理;Cerebras 最近已上市。OpenAI 新推出的 Ultrafast 模式目前承诺每秒处理 750 个 token,该模式由 Cerebras 提供支持。

低延迟芯片并不会取代 GPU——GPU 是 AI 芯片的主力,既能训练也能推理,且足够灵活以适应新技术和新模型。像 Groq 这样的低延迟芯片主要专注于服务模型的一个部分,即解码阶段。Harris 表示,这不是要取代 GPU,而是要为工作负载的相应部分使用合适价格、合适性能的处理器。

英伟达目前正在提升 Vera Rubin 系统的出货量,该系统于今年早些时候开始生产。在 3 月份的 Vera Rubin 和 Groq 3 LPX 发布会上,英伟达 CEO 黄仁勋预计,从当前 Blackwell 芯片到新的 Vera Rubin 系统,到 2027 年累计销售额将达到 1 万亿美元。黄仁勋当时表示,将把用于编程应用的数据中心空间中的四分之一分配给 Groq 芯片,其余数据中心空间则全部用于 Vera Rubin。