AMD 在上週的 Advancing AI 釋出會上正式推出 ROCm.ai,這是一項全新的“開發者體驗”,將 AI 程式設計智慧體引入 AMD 的 GPU 開發工具棧 ROCm(Radeon Open Compute)。ROCm 是 AMD 約 10 年前推出的開源 GPU 加速計算平台,包含核心執行時、驅動和庫,開發者可藉助 PyTorch、TensorFlow 等框架編寫 AI、高效能運算等應用。

傳統上,充分發揮 GPU 效能需要深厚的底層程式設計經驗。AMD 高階副總裁 Vamsi Boppana 表示,過去一年 AMD 工程師已在內部使用 AI 輔助編碼工具生成 GPU 核心、最佳化程式碼、除錯問題並提升效能,結果令人驚訝。“在某些情況下,這些 AI 生成的核心好得驚人,甚至優於最手動調優的版本,”Boppana 說。基於這些成果,AMD 將 ROCm.ai 與 Instinct MI400 GPU 系列及 Helios 機架系統一同釋出。

ROCm.ai 包含多個元件。AMD Skills 是核心介面,已內建到 Claude、Codex、Cursor、Gemini 等現有程式設計智慧體中,提供“serving-llms-on-instinct”等技能。ROCm CLI(命令列介面)處於預覽階段,可確定性、可指令碼化地安裝 ROCm 軟體並管理環境。ROCm Console 提供遙測、日誌、執行時狀態等可見性,幫助開發者調優效能。ROCm Hyperloom 則是全新的 AI 驅動工作負載最佳化工具,旨在為 AMD GPU 上的端到端推理工作負載提供完全自主的智慧體系統,通過分析瓶頸、應用針對性最佳化並驗證正確性。

Boppana 在釋出會上展示了具體效能提升:在編寫 GPU 核心時,ROCm.ai 發現最佳化機會並實現 38% 的令牌吞吐提升;在 DeepSeek AI 模型上,通過塊縮放融合核心、快速快取量化和專家並行等技術,實現了 3.3 倍加速;總體而言,ROCm.ai 通過融合快閃記憶體注意力、更高效檢查點和高階並行策略,可將 AI 模型訓練效能平均提升 2.4 倍

目前,輝達資料中心 GPU 市場佔據主導地位,據 Silicon Analysts 分析,輝達份額約 75%–80%,而 AMD 僅約 7%。ROCm.ai 的推出旨在降低開發者從 CUDA 遷移的門檻,讓 AI 程式設計智慧體成為“ROCm 超級使用者”。Boppana 強調:“開發者不應手動推理每一層模型架構、核心選擇、通訊策略和機架部署。AI 正在改變這種體驗,這對 GPU 硬體和軟體來說是一個非常非常大的轉變。”

儘管 ROCm.ai 仍處於早期階段,但其展示的效能提升和易用性改進,可能逐步侵蝕 CUDA 的生態護城河。隨著 AMD Instinct MI400 系列和 Helios 機架系統的上市,AI 基礎設施層的競爭將更加激烈。