AI算力硬體的競爭焦點正從訓練轉向推理。隨著產業重心向推理環節遷移,定製化專用硬體獲得更多市場關注:AMD收購推理晶片企業TaalasEtched完成新一輪大額融資,多家AI實驗室也啟動自研晶片專案,專用ASIC的需求正在快速升溫。

訓練階段需要處理多樣化的演算法結構與海量資料,GPU憑藉平行計算能力和可程式設計性佔據主導。其核心價值在於靈活性——一套硬體架構可同時適配訓練與推理,覆蓋多種網路模型,配套成熟的軟體生態也降低了開發者的遷移成本。但通用性的另一面是電路存在大量冗餘,面對固定、大規模的推理任務時,能效表現受限。

推理階段則具備高度重複性與規模化特徵:同一模型架構被反覆呼叫,計算模式相對固定,這為專用積體電路(ASIC)留出空間。定製ASIC針對特定工作負載深度定製,剔除多餘計算單元,在目標場景下可實現更高吞吐與更優功耗。代價是硬體能力被限定在特定模型架構,跨場景適配薄弱,一旦演算法大幅迭代,芯片價值就會受到衝擊。

兩條路線並無絕對優劣,而是面向不同業務訴求的技術取捨。頭部廠商已開始調整產品定位:輝達收斂產品方向,聚焦4位至32位不同精度區間的AI工作負載;AMD則保留FP64高精度運算能力,面向高效能運算客戶維持完整通用算力,在通用GPU框架下做出差異化側重。

在推理ASIC賽道上,初創企業已完成從技術原型到實際部署的跨越。被AMD收購的Taalas推出HC1示範晶片,主打高速Token生成能力,在Llama 3.1-8B模型上實現很高的生成速度,但幾乎犧牲了通用適配能力。AMD計劃將這款ASIC整合至Helios整機機架,與Epyc CPUInstinct GPU搭配形成異構算力方案,並依託ROCm.ai補齊軟體整合能力,把專用加速單元嵌入既有通用算力體系。

Etched同樣代表Transformer定向最佳化ASIC的方向。該公司已完成7億美元新一輪融資,估值攀升至210億美元,量化機構Jane Street成為其首位落地客戶,首套機架已完成出貨並投入部署,同時手握超過10億美元訂單,覆蓋雲廠商與前沿AI機構。其Sohu晶片專為Transformer系列模型設計,可相容該架構下多款大模型,卻無法執行CNN、LSTM等其他型別網路。Etched宣稱在Llama 70B推理任務上實現很高吞吐效能,並推進機架、軟體、製造工藝的協同設計,提出低電壓推理、叢集級記憶體等技術理念,希望從叢集層面改善記憶體共享與整體執行效率。

AI原生企業與公有云服務商也在加速定製硬體佈局,不再單純依賴外部採購通用GPU。OpenAI披露與博通Celestica合作開發的Jalapeno推理處理器,後續將釋放更多效能細節。Anthropic傳出與三星洽談合作,計劃利用其2奈米製程與封裝技術開發AI訓練晶片;即便推進自研,企業仍會繼續採購輝達、谷歌、亞馬遜的算力產品,保持算力供給的多元結構。

各大公有云平台早已完成自研晶片的落地積累:谷歌雲的TPU、AWS的Trainium以及微軟雲的Maia,已形成成熟產品矩陣,服務內部與外部客戶。隨著AI行業投資逐步迴歸商業回報,推理環節的成本壓力凸顯,如何充分釋放硬體效能,已成為晶片設計領域新的競爭焦點。

推理算力的競爭並不意味著ASIC將全面取代通用GPU,二者更多是互補共存的關係。通用GPU依靠靈活生態,承接多變的模型迭代與訓練任務;定製ASIC在負載穩定的大規模推理場景釋放能效優勢,卻要承擔演算法迭代帶來的技術風險。從晶片初創企業到AI巨頭、雲服務商,市場參與者正根據自身業務定位選擇不同組合策略,異構算力架構預計將成為接下來一段時間行業的主流形態。未來硬體路線的走向,既取決於ASIC產品持續的實際效能驗證,也取決於大模型技術演進節奏,整個算力產業將在通用與定製之間持續尋找新的平衡。