在上海舉行的華為全聯接大會上,華為釋出了面向AI時代的Peerium計算架構以及作為其關鍵互聯技術的UnifiedBus靈衢匯流排。會後,華為輪值董事長徐直軍與海思首席科學家廖恆接受媒體採訪,就昇騰市場份額、950DT訓練進展、晶片產能瓶頸、光互聯路線及與輝達的技術差異等話題作出回應。

徐直軍明確表示,在中國市場統計輝達的市佔率很難,但「從我們能夠統計到的資料看,昇騰應該已經超過了輝達」。這一表態意味著華為首次公開宣稱其AI晶片在中國市場的份額已反超輝達。不過他也承認,昇騰目前滿足國內市場需求「還遠遠不足」,因此沒有全面拓展海外市場的計劃,僅有少數國家有少量測試和供給。

關於產品節奏,徐直軍透露,昇騰950率先推出的是PR版,主要面向推理,上市量不算大;基於950DT的超節點則主要用於訓練,目前仍在測試中,規模供貨預計在今年年底或明年初。從現階段測試結果看,他預計從明年開始將有大量模型訓練構築在950DT超節點上。他強調,制約昇騰進一步放量的主要問題「已經不是市場需求,而是供貨能力」,「現在能產多少就供多少」。

在技術路線上,徐直軍認為華為單晶片仍受國內工藝水平限制,但在多晶片互聯和系統架構上已形成自己的路線。他提到,Atlas 950超節點採用Peerium架構,目前25.6萬卡規模的叢集已在部署和測試中。廖恆補充說,25.6萬或約20萬這個數字並非隨意設定:當前模型引數規模已達5萬億級別,未來兩年中國預計出現約6至7個前沿AI實驗室,目標訓練引數規模在10萬億到40萬億之間的基礎模型;同時考慮到單個資料中心園區的電力輸送設計,20萬是一個相對保守的數字。

互聯技術是此次釋出的核心。徐直軍解釋,輝達分別用NVLink和InfiniBand應對Scale-up與Scale-out,但最新NVL72櫃內頻寬達1.8 TB/s,一齣櫃就降到0.2 TB/s,櫃間低頻寬無法支撐百萬處理器組成一台計算機。華為的靈衢基於統一協議,櫃間頻寬最高可達800 GB/s。廖恆補充,輝達方案在協議切換時至少涉及微秒級轉換時間,而UB將資料包從scale-up傳到scale-out網路可能只需約150納秒,可節省一個數量級。

光互聯方面,徐直軍介紹華為剛釋出基於NPO的Hi-ONE模組,支援7.2T高頻寬,光引擎距主晶片僅約5釐米,僅這部分需銅線電連線,基本可稱全光超節點。他預計未來兩到三年內很難有其他廠商做出該方案。廖恆表示,全光互聯最大障礙是對可靠性的擔憂,華為選擇內建光源方案是工程上的務實折中。徐直軍還提到,NPO相比CPO可帶來成本接近40%的下降,且光引擎出問題不會導致整個AI晶片報廢,在OIF上NPO已得到40家產業鏈廠商支援。

產能瓶頸方面,徐直軍認為中國的瓶頸與全球基本一致,全球產業界都沒有為AI如此浪湧式的發展做好準備。他預計全球供需平衡差不多在2029年能得到解決,中國可能還要慢一點。

談及生態,廖恆承認兩年前昇騰軟體層面存在巨大障礙,CUDA具有壓倒性優勢,但過去18個月發生巨大變化:模型數學複雜度提升、模型變得細粒度,演算法開發者必須轉向超大規模核心程式設計風格,新編譯器語言正逐步平衡CUDA壁壘,前沿實驗室已不再像兩年前那樣重視CUDA。他認為輝達與昇騰之間的差距已大幅縮小。

關於晶片自主化,徐直軍表示,中國有14億人口又是工業化大國,不能一直受制於人,「儘管水平差一點、先進性差一點,但解決有無問題」,推動晶片全面自主化、推動半導體產業整個鏈條的全面自主化「肯定是一條必由之路」,相信總有一天會變為現實。