Arm在9月16日一次性发布三项平台级更新,目标指向一个AI不再只是被动应答单条提示词的时代。按照Arm的设想,未来的AI智能体将连续运行在手机、数据中心、汽车、机器人等物理系统中,感知环境、围绕目标进行推理,并代替用户采取行动。三项发布分别是面向边缘设备的Arm CSS for Mobile 2、面向云基础设施的Neoverse CSS N4,以及面向物理AI的Arm Total Design计划,共同指向一个高度碎片化计算版图上的通用架构与软件底座。
在边缘侧,Arm把C2-Ultra CPU集群与Mali G2-Ultra NX GPU组合成一个平台。C2-Ultra集成了SME2,即Arm可扩展矩阵扩展的第二代,用于加速机器学习模型大量使用的矩阵运算,同时保留通用CPU的灵活性。Arm称,两颗支持SME2的C2-Ultra核心在近期模型上的AI性能达到上一代设计的1.7倍;在一套代表性旗舰配置中,单线程性能提升15%、网页浏览速度提升15%、应用启动速度提升12%、多线程性能提升12%。
Arm强调CPU改进的意义在于,AI智能体并不只是神经网络推理负载。一个可用的智能体需要检索上下文、运行应用、调用工具、访问数据库、通过网络通信并核验结果,这些工作大多依赖CPU与操作系统服务。更快的本地执行可以缩短从请求到智能体动作之间的延迟,同时把敏感的个人上下文留在设备本地。
Mali G2-Ultra NX则针对另一个瓶颈——高质量图形渲染成本不断上升。它的神经加速器直接集成进GPU的着色器核心,支持神经超采样、神经帧率提升以及超采样与去噪的组合。这类技术减少传统方式渲染的信息量,再用学习到的模型重建更高分辨率画面或补充帧。Arm称其神经超采样可把540p输出转换为1080p,帧率提升可把30帧/秒变为60帧/秒,并宣称帧率与效率最高提升四倍、DRAM流量减少70%。重新设计的执行引擎与第三代光线追踪单元则面向更传统的渲染,包括虚幻引擎5的Nanite与Lumen技术,Arm报告基准测试提升24%、非AI游戏性能提升14%、光线追踪工作负载减少70%。
在数据中心侧,Neoverse CSS N4把CPU核心、缓存、内存管理、互连与系统IP打包成一个可配置的计算子系统。客户可以调整核心数量、缓存容量、I/O与连接能力,同时省去组装定制芯片所需的大量集成工作,配置规模最高可达单裸片128核。与Neoverse CSS N3相比,Arm称在其设定的参考条件下,插槽性能达到两倍、每瓦性能为1.25倍、内存带宽为1.75倍。
这里的技术看点在于可配置性。智能体负载把模型推理与CPU密集的编排、沙箱执行、存储、网络和数据库混在一起,云厂商因此既需要高密度、高效率的基础设施,也需要性能更高的处理器。CSS N4的用意是缩短通往针对不同需求优化的芯片的路径。
物理AI计划则把平台延伸到机器人、工业机械与汽车领域。在这些场景中,从感知环境到产生物理动作之间的「光子到扭矩」延迟至关重要。Arm Total Design for Physical AI将把芯片供应商、模型开发者、传感器供应商、制造商与安全专家聚集到一起,并提出一套机器人能力框架,为参与者提供描述可复用能力的通用方式。
整体来看,Arm把自己定位为分布式AI的连接组织。它的优势不在于某一款加速器或模型,而在于一套已经覆盖数十亿设备、并由超过2200万开发者支持的架构。如果Arm能让软件与AI能力从云端系统到手机与机器之间自由移植,开发者就有可能只构建一次智能体,再把各个组件部署到延迟、隐私、功耗与性能最合适的位置。
对关注AI产业链的读者而言,这次发布释放的信号是:随着智能体从演示走向日常运行,算力需求会从单一的大模型推理,扩散到CPU编排、边缘推理、图形渲染与物理控制等多个环节。Arm选择用统一的架构与软件栈去承接这种扩散,其成败将取决于下游芯片厂商与开发者是否愿意围绕这套底座构建产品。