AMD 在上周的 Advancing AI 发布会上正式推出 ROCm.ai,这是一项全新的“开发者体验”,将 AI 编程智能体引入 AMD 的 GPU 开发工具栈 ROCm(Radeon Open Compute)。ROCm 是 AMD 约 10 年前推出的开源 GPU 加速计算平台,包含核心运行时、驱动和库,开发者可借助 PyTorch、TensorFlow 等框架编写 AI、高性能计算等应用。
传统上,充分发挥 GPU 性能需要深厚的底层编程经验。AMD 高级副总裁 Vamsi Boppana 表示,过去一年 AMD 工程师已在内部使用 AI 辅助编码工具生成 GPU 内核、优化代码、调试问题并提升性能,结果令人惊讶。“在某些情况下,这些 AI 生成的内核好得惊人,甚至优于最手动调优的版本,”Boppana 说。基于这些成果,AMD 将 ROCm.ai 与 Instinct MI400 GPU 系列及 Helios 机架系统一同发布。
ROCm.ai 包含多个组件。AMD Skills 是核心接口,已内置到 Claude、Codex、Cursor、Gemini 等现有编程智能体中,提供“serving-llms-on-instinct”等技能。ROCm CLI(命令行界面)处于预览阶段,可确定性、可脚本化地安装 ROCm 软件并管理环境。ROCm Console 提供遥测、日志、运行时状态等可见性,帮助开发者调优性能。ROCm Hyperloom 则是全新的 AI 驱动工作负载优化工具,旨在为 AMD GPU 上的端到端推理工作负载提供完全自主的智能体系统,通过分析瓶颈、应用针对性优化并验证正确性。
Boppana 在发布会上展示了具体性能提升:在编写 GPU 内核时,ROCm.ai 发现优化机会并实现 38% 的令牌吞吐提升;在 DeepSeek AI 模型上,通过块缩放融合内核、快速缓存量化和专家并行等技术,实现了 3.3 倍加速;总体而言,ROCm.ai 通过融合闪存注意力、更高效检查点和高级并行策略,可将 AI 模型训练性能平均提升 2.4 倍。
目前,英伟达在数据中心 GPU 市场占据主导地位,据 Silicon Analysts 分析,英伟达份额约 75%–80%,而 AMD 仅约 7%。ROCm.ai 的推出旨在降低开发者从 CUDA 迁移的门槛,让 AI 编程智能体成为“ROCm 超级用户”。Boppana 强调:“开发者不应手动推理每一层模型架构、内核选择、通信策略和机架部署。AI 正在改变这种体验,这对 GPU 硬件和软件来说是一个非常非常大的转变。”
尽管 ROCm.ai 仍处于早期阶段,但其展示的性能提升和易用性改进,可能逐步侵蚀 CUDA 的生态护城河。随着 AMD Instinct MI400 系列和 Helios 机架系统的上市,AI 基础设施层的竞争将更加激烈。