雅虎財經影片節目 In the Loop 主持人 Ejaaz Ahamadeen 在最新一期節目中分析了 Cerebras(CBRS)晶片與傳統 AI 晶片的差異,並探討了超快推理的市場機會。

Ahamadeen 指出,Cerebras 晶片將記憶體與 GPU 整合在一起,形成一個單一單元,因此從傳送提示到模型執行的時間大幅縮短。這種設計雖然成本更高,但響應速度極快,能立即輸出結果。他提到,Cerebras 晶片的記憶體容量約為 44GB,而當今現代模型的權重資料往往達到 數 TB 級別,因此仍需多塊晶片協同工作。但如果企業願意支付前期成本,就能以極快速度服務大量使用者,這對 Jane Street 等公司極具價值。

Ahamadeen 將 Cerebras 的獨特賣點概括為“銷售更快的推理”。他進一步思考:快速推理的實際市場機會究竟有多大?是否僅限於 Jane Street 這類交易演算法公司,還是其他行業也願意為獲得這種晶片支付溢價,以擊敗競爭對手並賺取豐厚利潤?

為了直觀展示速度差異,Ahamadeen 在節目中用演示對比了不同推理速度。普通 AI 模型的響應速度對一般使用者已足夠;輝達(NVDA)的超快演示則快得多,眨眼間答案就已出現。但他指出,對普通使用者而言,這種速度並非必需,也不值得為此每月支付 500 美元。然而,對於 Jane Street 這樣的公司,毫秒甚至秒級的延遲可能意味著 數千萬至數億美元 的交易損失,因此速度至關重要。

Ahamadeen 展示了 Cerebras 超快推理達到 每秒 750 個 token 的效果,稱其幾乎在螢幕上瞬間出現,耗時僅 0.2 秒。而 Cerebras 的目標是達到 每秒 5000 個 token,在演示中顯示為 0.0 秒,人類幾乎無法感知。他強調,這些晶片的目標客戶並非零售使用者,而是那些時間至關重要的企業——延遲可能造成 數十億至數百億美元 的損失。

節目由 高通(QCOM) 贊助。Ahamadeen 的討論還涉及 谷歌(GOOG) 等公司,但未展開具體細節。整體來看,Cerebras 正試圖以超快推理在 AI 晶片市場中開闢差異化定位,專注於對延遲極度敏感的企業客戶。