面壁智能联合开源社区OpenBMB于8月4日开源了全球首个支持Stencil(模板计算)自动研究、自动部署的AI优化系统ForgeStencil。据官方披露,该系统在一周内完成了超过100个真实工业和科学计算软件的自动优化,这一工作量相当于每年投入4至8名工程师、等效研发投入300万至1000万元。相比之下,人类专家每人每年通常只能精调不超过20个应用软件,而ForgeStencil将单个应用的优化时长压缩至小时级别,研发吞吐提升约1至2个数量级,研发效率提升约100倍,且该效率可随算力规模扩大而并行放大。

Stencil是一种算力密集的核心计算模式,广泛存在于高性能计算(HPC)软件底层,其核心是对规则网格上每个点及其固定邻域执行相同局部运算。由于Stencil属于访存密集型计算,性能受内存带宽约束,通常占据应用绝大部分耗时,其优化水平直接决定工业与科研仿真软件的运行效率。此前,Stencil优化高度依赖稀缺的HPC专家,难以规模化,ForgeStencil正是为解决这一难题而生。

ForgeStencil基于面壁智能提出的Forge Engineering软件开发思路打造,是其继5月发布AI制造AI成果ForgeTrain之后的又一技术突破。该系统首次实现了从提出优化想法到应用无缝部署的全自动闭环:人类只需提供待优化的应用源码,ForgeStencil即可自动完成分析真实应用、定位热点函数、锻造Kernel、算子替换、正确性验证与集成回原应用,中间无需人类专家介入优化决策。

系统由Kernel Agent(理论方向)与App Agent(工程落地)组成。Kernel Agent专注于自主研究并合成高性能Kernel,可针对主流Stencil类型、多种Shape与精度要求,自主构建专用算子矩阵,将数学表达写成逼近硬件物理极限的代码。官方披露,与市面上的Halide、Devito、EBISU、DRStencil、FlashFFTStencil等开源算法相比,在同等硬件下,ForgeStencil在fp32同精度对比中获得几何平均2.35倍加速比,在fp16混合精度读写下额外获得1.95倍提速,在更难的变系数Stencil全部Shape上相比最优基线取得几何平均1.34倍加速。

App Agent则负责为每个应用单独打造优化方案,定位性能热点、建立应用自身的GPU基线、锻造候选优化、用程序自带的校验与计时验证,再集成回原应用。在框架层,App Agent寻找算子融合机会并提取待优化的Stencil算子,Kernel Agent优化具体算子,其建立的算子矩阵作为后续开发的知识库,最终App Agent使用应用自带的测例做端到端评测,确保优化面向真实场景。这种协同机制实现了从自动生成代码向自动研究优化、从局部算子提速向真实应用部署的进化。

目前,ForgeStencil已在一批主流科学软件与基准上完成自动优化,并在应用自带的GPU实现之上实现端到端加速,其中42%直接对应真实工业生产软件厂家。具体应用包括:Hypre(LLNL结构化多重网格求解器库,加速3.86倍)、Minisweep(Sn离散纵标输运,核反应堆中子学,加速5.78倍)、gprMax/FDTD(Yee网格Maxwell电磁仿真,加速2.47倍)、RTM逆时偏移(油气地震成像,加速1.81倍)、TOTAL E P minimod(道达尔油气地震mini-app,加速1.22倍)、QuantLib债券定价(量化金融,加速1.82倍)、FHd非笛卡尔MRI重建(加速2.45倍)、DBT数字乳腺断层成像反投影(加速1.63倍)。

与人类专家相比,ForgeStencil的另一大优势是拥有大量并行的Agent共享知识库,可以共享经验,进一步提升优化效率。综合来看,ForgeStencil将Stencil算子的优化及其所决定的工业软件和科学计算应用优化首次实现了规模化的可能性。短期内,存量软件的自动优化可带来直接收益,已有的以Stencil为热点的工业或科学软件能在小时级生成接近硬件极限性能的算子实现,节约算力、压缩研发时间。长远来看,Stencil算子背后涵盖CAE仿真、地震成像、电磁与流体计算等工业软件,这些软件性能优化实现自动化,将进一步加速国内制造业的发展。