Arm在9月16日一次性發布三項平台級更新,目標指向一個AI不再只是被動應答單條提示詞的時代。按照Arm的設想,未來的AI智慧體將連續執行在手機、資料中心、汽車、機器人等物理系統中,感知環境、圍繞目標進行推理,並代替使用者採取行動。三項釋出分別是面向邊緣裝置的Arm CSS for Mobile 2、面向雲基礎設施的Neoverse CSS N4,以及面向物理AI的Arm Total Design計劃,共同指向一個高度碎片化計算版圖上的通用架構與軟體底座。
在邊緣側,Arm把C2-Ultra CPU叢集與Mali G2-Ultra NX GPU組合成一個平台。C2-Ultra集成了SME2,即Arm可擴充套件矩陣擴充套件的第二代,用於加速機器學習模型大量使用的矩陣運算,同時保留通用CPU的靈活性。Arm稱,兩顆支援SME2的C2-Ultra核心在近期模型上的AI效能達到上一代設計的1.7倍;在一套代表性旗艦配置中,單執行緒效能提升15%、網頁瀏覽速度提升15%、應用啟動速度提升12%、多執行緒效能提升12%。
Arm強調CPU改進的意義在於,AI智慧體並不只是神經網路推理負載。一個可用的智慧體需要檢索上下文、執行應用、呼叫工具、訪問資料庫、通過網路通訊並核驗結果,這些工作大多依賴CPU與作業系統服務。更快的本地執行可以縮短從請求到智慧體動作之間的延遲,同時把敏感的個人上下文留在裝置本地。
Mali G2-Ultra NX則針對另一個瓶頸——高質量圖形渲染成本不斷上升。它的神經加速器直接整合進GPU的著色器核心,支援神經超取樣、神經幀率提升以及超取樣與去噪的組合。這類技術減少傳統方式渲染的資訊量,再用學習到的模型重建更高解析度畫面或補充幀。Arm稱其神經超取樣可把540p輸出轉換為1080p,幀率提升可把30幀/秒變為60幀/秒,並宣稱幀率與效率最高提升四倍、DRAM流量減少70%。重新設計的執行引擎與第三代光線追蹤單元則面向更傳統的渲染,包括虛幻引擎5的Nanite與Lumen技術,Arm報告基準測試提升24%、非AI遊戲效能提升14%、光線追蹤工作負載減少70%。
在資料中心側,Neoverse CSS N4把CPU核心、快取、記憶體管理、互連與系統IP打包成一個可配置的計算子系統。客戶可以調整核心數量、快取容量、I/O與連線能力,同時省去組裝定製晶片所需的大量整合工作,配置規模最高可達單裸片128核。與Neoverse CSS N3相比,Arm稱在其設定的參考條件下,插槽效能達到兩倍、每瓦效能為1.25倍、記憶體頻寬為1.75倍。
這裡的技術看點在於可配置性。智慧體負載把模型推理與CPU密集的編排、沙箱執行、儲存、網路和資料庫混在一起,雲廠商因此既需要高密度、高效率的基礎設施,也需要效能更高的處理器。CSS N4的用意是縮短通往針對不同需求最佳化的晶片的路徑。
物理AI計劃則把平台延伸到機器人、工業機械與汽車領域。在這些場景中,從感知環境到產生物理動作之間的「光子到扭矩」延遲至關重要。Arm Total Design for Physical AI將把晶片供應商、模型開發者、感測器供應商、製造商與安全專家聚集到一起,並提出一套機器人能力框架,為參與者提供描述可複用能力的通用方式。
整體來看,Arm把自己定位為分散式AI的連線組織。它的優勢不在於某一款加速器或模型,而在於一套已經覆蓋數十億裝置、並由超過2200萬開發者支援的架構。如果Arm能讓軟體與AI能力從雲端系統到手機與機器之間自由移植,開發者就有可能只構建一次智慧體,再把各個元件部署到延遲、隱私、功耗與效能最合適的位置。
對關注AI產業鏈的讀者而言,這次釋出釋放的訊號是:隨著智慧體從演示走向日常執行,算力需求會從單一的大模型推理,擴散到CPU編排、邊緣推理、圖形渲染與物理控制等多個環節。Arm選擇用統一的架構與軟體棧去承接這種擴散,其成敗將取決於下游晶片廠商與開發者是否願意圍繞這套底座構建產品。