推理晶片賽道正在快速升溫。過去幾年,推理消耗的token呈爆炸式增長,token經濟隨之成型,專用推理晶片成為兵家必爭之地。據矽谷101的一檔對話節目梳理,輝達去年年底以約200億美元與AI晶片公司Groq達成技術授權協議,並吸納其創始人Jonathan Ross等核心團隊,被外界視為一次變相收購;做晶圓級大晶片的Cerebras今年6月完成IPO,市值達到670億美元OpenAI則聯手博通推出首款自研推理晶片Jalapeño,從設計到流片僅用了9個月。加上此前已佈局的谷歌TPU,推理晶片牌桌上的玩家越來越多。

這場競爭的核心問題在於:各家真正比拼的是什麼?為什麼會走向不同的技術路徑?

參與對話的兩位AI晶片創業者——負責推理晶片硬體與系統架構的Mark,以及負責軟體和編譯器的子揚——從訓練與推理的本質差異切入。Mark指出,訓練本身沒有直接回報,投入訓練是在賭一個最強模型,再靠未來推理收回成本;而推理的商業邏輯很直接:使用者願意為每100萬個token付多少錢,推理這100萬token要花多少成本。因此推理追求的是價效比,而非極致效能。

從技術層面看,推理分為prefilldecode兩個階段。prefill階段有充足並行度,可以把模型從HBM讀入計算單元后同時處理大量token;但decode階段必須逐個生成token,每生成一個token都要把整個模型權重從儲存介質讀一遍。這意味著推理對算力和頻寬的需求與訓練有本質不同。

GPU的應對方式是batching——收集上萬個使用者的推理任務並行處理。但這導致單個使用者感受到延遲:你不僅在等自己的token,還在等同一批裡其他使用者的token。Mark認為,未來理想的推理系統可能包含多種不同晶片,把decode過程做得足夠便宜、足夠快,這可能需要打破GPU傳統架構,使用不同於HBM的儲存介質。

對話中重點討論了SRAMDRAMHBM三種儲存介質的取捨。DRAM容量大但離計算單元遠、速度慢;HBM把DRAM搬到計算晶片旁邊,容量大速度快,但價格昂貴且產能緊張;SRAM可以直接做在計算晶片內部,速度最快,但儲存同樣資料所需芯片面積是DRAM的幾十倍甚至上百倍。

子揚指出,GroqCerebras的速度與價效比本質上都來自SRAM,儘管它們並未著重強調這一點。其他美國AI推理晶片公司如d-MatrixMatX也在往SRAM方向走,谷歌TPU亞馬遜Trainium每一代SRAM也都在變大。從頻寬角度看,SRAM無論絕對數量還是每塊錢買到的價效比都非常高,行業正在向這個方向收斂。

但SRAM的代價是單晶片容量低,可能比HBM低兩個數量級。解決辦法是把系統做得更大——用幾百甚至幾千個晶片來容納全部模型權重。然而系統變大後,瓶頸就卡在通訊上。

在解決大叢集通訊排程問題上,Groq和Cerebras走向了不同路線。Groq的思路是把排程放在執行之前,由編譯器在編譯時把未來晶片系統裡所有計算和通訊都排布好,執行時就沒有排程問題。Cerebras則更直接:把一個櫃子裡幾百個晶片的事情塞到一整塊晶圓上,物理距離和線的頻寬自然更好。

但兩位嘉賓指出,這兩家公司在做技術決策時,Transformer還沒有出現,它們沒有足夠資訊判斷未來需要面向什麼樣的workload最佳化。Cerebras面臨的大挑戰是如何控制整個晶圓的良率和成本;Groq則是在選擇依靠編譯器做完全靜態排程時,無法預知如今Transformer推理中如此大的動態性——比如MoE混合專家模型)的產生。

子揚解釋,MoE網路有非常多專家,每個token推理時會啟用其中一小部分,這個選擇在執行時決定,編譯時無法預測。單顆SRAM無法把整個網路放進去,必然出現專家分佈在不同晶片上的排程問題。靜態排程面對這種動態性時,要麼保守地把所有專家都送過去導致部分晶片空轉,要麼換一種方式切分模型,但後者很難做到高效。

不過,這種trade-off隻影響價效比,不影響速度。當前市場對Groq和Cerebras的定位就是快,價效比尚未被充分討論。如果推理速度能比別人快幾倍,就可以為此收取溢價。Mark也提到,從商業角度講,如果別人願意為更快買單,你不會主動告訴別人你的成本其實更便宜。

關於Groq創始人Jonathan Ross——他也是谷歌TPU的核心設計者之一——子揚指出,Groq的整個思路是圍繞編譯器展開的。Ross本人曾是編譯器團隊的負責人,他出來創業的思路就是把確定性編譯做好,然後圍繞這個編譯去設計硬體,從靜態編譯和靜態排程出發重新設計晶片架構。

這場對話還涉及了輝達首席科學家Bill Dally的設計哲學。作為現代GPU並行架構最重要的奠基者之一,Dally的思考方式通過其學生Mark的視角被呈現出來,為理解當前推理晶片的技術分歧提供了一個更深層的背景。