大模型進入推理密集期後,算力的衡量方式正從關注訓練峰值轉向單位Token的價效比。在這一背景下,國產AI晶片廠商中昊芯英在WAIC期間釋出了第二代自研TPU晶片“須臾”,並宣佈華東地區首個國產TPU智算千卡叢集在杭州落成。

須臾是中昊芯英的第二代產品,混合精度浮點算力達到896TFLOPS,8-bit推理算力達到1792TOPS,整體效能約為上一代晶片的三倍,單晶片額定功耗為600W。中昊芯英聯合創始人、CTO鄭瀚尋將效能提升歸因於計算流水線重構、雙芯粒同基板封裝,以及片上儲存容量和頻寬的提升。目前,該晶片已完成QwenDeepSeekGLM等主流開源模型的基礎適配,並能在新模型釋出後較快跑通流程。

TPU(張量處理單元)最初由谷歌在2016年公開,專為深度學習中的張量計算設計,犧牲了一部分通用性以換取在特定任務中的計算密度和能效表現。與GPU最初為圖形渲染設計不同,TPU從一開始就瞄準AI負載。當前大模型推理正走向PD分離——將處理輸入內容的Prefill階段與逐Token輸出的Decode階段拆開排程,前者需要快速處理大量上下文,後者更看重持續輸出和低延遲。中昊芯英創始人、CEO楊龔軼凡指出,將兩種任務放在同一套資源裡執行容易出現資源閒置或排隊,拆開後集群可以圍繞不同負載進行更細緻的配置,這正是TPU再次獲得關注的原因。

此次落成的杭州國產TPU千卡叢集,由杭州電信中興通訊和中昊芯英共同建設,面向大模型訓練、推理和科學計算等場景提供算力服務,也是中國電信體系內首個大規模國產TPU叢集部署專案。運營商正在經歷角色變化:過去客戶租用伺服器、儲存和頻寬,現在越來越多企業希望直接獲得模型呼叫能力或按Token購買服務。杭州電信並未將TPU視為唯一選擇,其現有佈局中同時包含GPU算力池,也在探索其他國產晶片路線。未來的智算中心很可能長期保持異構狀態,晶片架構各自承擔擅長的任務,運營商負責將底層資源組織成面向使用者的服務。

這種模式對叢集排程提出了更高要求。杭州電信方面透露,經過數月軟硬體調優,TPU叢集的Token輸出效率較年初提升超過10倍。這一資料是系統最佳化的綜合結果,模型版本、運算元實現、伺服器配置、網路頻寬和排程方式都會影響最終能交付的有效Token數量。中興通訊承擔網路和系統整合能力,千卡叢集向萬卡規模擴充套件時,晶片之間的連線會迅速成為瓶頸——計算能力提升得越快,通訊、儲存和散熱越容易拖住整體效率。

國產TPU要進入市場,既要解決晶片本身的效能問題,也要回答開發者如何遷移、模型如何適配、客戶如何呼叫的問題。GPU生態長期佔據主導,CUDA工具鏈和開發習慣構成了很高的遷移門檻。中昊芯英方面表示,基礎適配和商業化效果之間仍有距離,要把模型的吞吐量、延遲和成本調到可用水平,往往需要圍繞運算元、編譯工具和排程策略持續最佳化。谷歌TPU的經驗說明,專用晶片的價值往往建立在完整的軟硬體體系之上,對於國內廠商而言,晶片研發、量產交付和軟體生態仍需同步推進。