輝達週一宣佈,其 Groq 3 LPX 機架已全面投產,這是該公司史上最大收購——以 200 億美元收購晶片初創公司 Groq 資產——所獲技術的商業化里程碑。輝達高階總監 Dion Harris 向記者表示,該機架將部署在 neocloud 服務商 Nebius 的資料中心,與 Vera 中央處理器和 Rubin 圖形處理器搭配使用,並將在今年晚些時候上線。

輝達急於將 Groq 晶片量產並交付客戶,凸顯了低延遲推理在 AI 領域日益增長的重要性。低延遲推理能讓 AI 智慧體在使用者互動時幾乎無延遲響應,尤其對程式設計等場景至關重要。輝達表示,雲服務商可以為此類 token 收取更高費用。Harris 在電話會議中稱,對於提供 token 服務的廠商而言,這解鎖了為那些對延遲敏感的服務協議要求最高的使用者和客戶提供高階服務層級的能力。

去年 12 月,輝達以 200 億美元從晶片初創公司 Groq 手中收購資產,這是該公司歷史上最大的一筆收購。Groq 架構在晶片裸片上集成了 500 兆位元組的高速 SRAM,以減少記憶體相關的瓶頸。Groq 晶片由三星代工,而輝達的 GPU 則由台積電製造。輝達將 256 個 Groq 3 晶片封裝進其 LPX 機架中。輝達援引 Artificial Analysis 的基準測試稱,其 Groq 3 LPX 機架每秒可處理 3400 個 token。

這一領域競爭激烈。較小的 GPU 製造商 AMD 今年早些時候宣佈,將把其機架級系統與 Cerebras 的晶片整合,專注於低延遲推理;Cerebras 最近已上市。OpenAI 新推出的 Ultrafast 模式目前承諾每秒處理 750 個 token,該模式由 Cerebras 提供支援。

低延遲晶片並不會取代 GPU——GPU 是 AI 晶片的主力,既能訓練也能推理,且足夠靈活以適應新技術和新模型。像 Groq 這樣的低延遲晶片主要專注於服務模型的一個部分,即解碼階段。Harris 表示,這不是要取代 GPU,而是要為工作負載的相應部分使用合適價格、合適效能的處理器。

輝達目前正在提升 Vera Rubin 系統的出貨量,該系統於今年早些時候開始生產。在 3 月份的 Vera Rubin 和 Groq 3 LPX 釋出會上,輝達 CEO 黃仁勳預計,從當前 Blackwell 晶片到新的 Vera Rubin 系統,到 2027 年累計銷售額將達到 1 萬億美元。黃仁勳當時表示,將把用於程式設計應用的資料中心空間中的四分之一分配給 Groq 晶片,其餘資料中心空間則全部用於 Vera Rubin。