半導體研究機構SemiAnalysis在7月13日的推文中,對輝達在vLLM推理引擎上的效能最佳化給予高度評價,同時明確指出AMD在部分模型的vLLM支援上仍有較大追趕空間。這一判斷將AI晶片競爭的焦點從單純的硬體引數競賽,重新拉回到軟體生態的深度與全面性上。
以Kimi K2.5這一千億引數級混合專家模型為例,差距尤為直觀。輝達GB200 NVL72通過機架級NVLink將72張GPU高速互聯,支援寬專家並行規模達8至16,每GPU吞吐量可超12000 token/s。其關鍵在於,每張GPU承載的專家權重大幅減少,HBM頻寬壓力降低,All-to-All通訊在高速NVLink域內完成,避免了經由較慢的InfiniBand網路。相比之下,AMD MI355X在同一測試中表現明顯遜色,主要受限於難以實現同等規模的專家並行與機架級互聯。
在軟體層面,輝達推出的Dynamo分散式推理框架將vLLM深度整合,針對MoE模型實現了預填充與解碼分離、高效KV快取傳輸以及雙批次重疊等最佳化,在NVL72上充分釋放硬體潛力。而AMD目前仍主要依賴標準vLLM與DISAGG版本,針對超大MoE模型與寬並行場景的深度最佳化尚未跟上。
SemiAnalysis將AMD的落後限定在“部分模型”上,這一措辭包含兩層資訊。第一,AMD並非全面落後,在通用計算場景中,其MI系列GPU已具備一定競爭力,Meta近期簽署的鉅額採購訂單也驗證了這一點。第二,“部分”這一限定恰恰凸顯了當前差距的實質——全面性軟體生態覆蓋的缺失。在AI推理場景中,企業客戶追求的是穩定、可預期的部署體驗。維護兩套軟體棧以覆蓋不同模型的成本,往往是決策時的決定性因素。AMD要完成從“部分領先”到“全面可用”的跨越,所需的軟體工程投入可能比硬體迭代更為耗時,這意味著要在數以千計的模型架構、不斷演進的開源框架以及分散的開發者社群中建立廣泛的相容性和信任。
這一判斷與SemiAnalysis兩週前的分析形成呼應。彼時,該機構指出輝達“CUDA護城河正遭緩慢侵蝕”,公司最大的競爭壓力來自越來越多超大規模雲廠商和AI模型公司開始採用自研ASIC,針對訓練或推理等特定場景構建專用晶片體系。例如,Anthropic已形成由谷歌TPU、亞馬遜Trainium和輝達GPU共同構成的多平台算力架構,大量Claude模型訓練運行於TPU,Claude Code推理則越來越多部署於Trainium,輝達GPU的份額正遭自研ASIC緩慢侵蝕。
然而,此次對vLLM效能的正面評價表明,輝達在推理軟體棧深度最佳化上的領先幅度,並未隨硬體競爭格局的演變而同步收窄。當AI產業重心從訓練向推理遷移,軟硬體的戰略價值正在發生結構性重估。訓練任務集中、可控,硬體效能差距可憑資本投入彌補;推理則是分散式、持續性的,微秒級延遲差異在每天數十億次呼叫中被成倍放大,直接轉化為成本結構的分化。
輝達的軟體生態壁壘由三個層面疊加構成:覆蓋約400萬開發者的CUDA工具鏈及其二十年積累;對所有主流機器學習框架的優先適配;以及cuDNN、TensorRT、NCCL等最佳化庫形成的深度繫結。三者疊加產生的遷移成本,遠超任何單一硬體引數的差距。SemiAnalysis選取vLLM作為評判基準,本身即傳遞出一個判斷——開源推理生態正在成為衡量AI晶片真實效能的關鍵戰場。對於每天執行數十億次推理呼叫的AI企業而言,“部分模型支援良好”與“所有模型穩定最佳化”之間的鴻溝,在規模效應下會被急劇放大。在硬體競爭日趨白熱化、自研ASIC不斷蠶食推理份額的背景下,輝達在推理軟體棧上的積累深度,正在成為比硬體引數更持久的競爭壁壘。