面壁智慧聯合開源社群OpenBMB於8月4日開源了全球首個支援Stencil(模板計算)自動研究、自動部署的AI最佳化系統ForgeStencil。據官方披露,該系統在一週內完成了超過100個真實工業和科學計算軟體的自動最佳化,這一工作量相當於每年投入4至8名工程師、等效研發投入300萬至1000萬元。相比之下,人類專家每人每年通常只能精調不超過20個應用軟體,而ForgeStencil將單個應用的最佳化時長壓縮至小時級別,研發吞吐提升約1至2個數量級,研發效率提升約100倍,且該效率可隨算力規模擴大而並行放大。

Stencil是一種算力密集的核心計算模式,廣泛存在於高效能運算(HPC)軟體底層,其核心是對規則網格上每個點及其固定鄰域執行相同區域性運算。由於Stencil屬於訪存密集型計算,效能受記憶體頻寬約束,通常佔據應用絕大部分耗時,其最佳化水平直接決定工業與科研模擬軟體的執行效率。此前,Stencil最佳化高度依賴稀缺的HPC專家,難以規模化,ForgeStencil正是為解決這一難題而生。

ForgeStencil基於面壁智慧提出的Forge Engineering軟體開發思路打造,是其繼5月釋出AI製造AI成果ForgeTrain之後的又一技術突破。該系統首次實現了從提出最佳化想法到應用無縫部署的全自動閉環:人類只需提供待最佳化的應用原始碼,ForgeStencil即可自動完成分析真實應用、定位熱點函式、鍛造Kernel、運算元替換、正確性驗證與整合回原應用,中間無需人類專家介入最佳化決策。

系統由Kernel Agent(理論方向)與App Agent(工程落地)組成。Kernel Agent專注於自主研究併合成高效能Kernel,可針對主流Stencil型別、多種Shape與精度要求,自主構建專用運算元矩陣,將數學表達寫成逼近硬體物理極限的程式碼。官方披露,與市面上的Halide、Devito、EBISU、DRStencil、FlashFFTStencil等開源演算法相比,在同等硬體下,ForgeStencil在fp32同精度對比中獲得幾何平均2.35倍加速比,在fp16混合精度讀寫下額外獲得1.95倍提速,在更難的變係數Stencil全部Shape上相比最優基線取得幾何平均1.34倍加速。

App Agent則負責為每個應用單獨打造最佳化方案,定位效能熱點、建立應用自身的GPU基線、鍛造候選最佳化、用程式自帶的校驗與計時驗證,再整合回原應用。在框架層,App Agent尋找運算元融合機會並提取待最佳化的Stencil運算元,Kernel Agent最佳化具體運算元,其建立的運算元矩陣作為後續開發的知識庫,最終App Agent使用應用自帶的測例做端到端評測,確保最佳化面向真實場景。這種協同機制實現了從自動生成程式碼向自動研究最佳化、從區域性運算元提速向真實應用部署的進化。

目前,ForgeStencil已在一批主流科學軟體與基準上完成自動最佳化,並在應用自帶的GPU實現之上實現端到端加速,其中42%直接對應真實工業生產軟體廠家。具體應用包括:Hypre(LLNL結構化多重網格求解器庫,加速3.86倍)、Minisweep(Sn離散縱標輸運,核反應堆中子學,加速5.78倍)、gprMax/FDTD(Yee網格Maxwell電磁模擬,加速2.47倍)、RTM逆時偏移(油氣地震成像,加速1.81倍)、TOTAL E P minimod(道達爾油氣地震mini-app,加速1.22倍)、QuantLib債券定價(量化金融,加速1.82倍)、FHd非笛卡爾MRI重建(加速2.45倍)、DBT數字乳腺斷層成像反投影(加速1.63倍)。

與人類專家相比,ForgeStencil的另一大優勢是擁有大量並行的Agent共享知識庫,可以共享經驗,進一步提升最佳化效率。綜合來看,ForgeStencil將Stencil運算元的最佳化及其所決定的工業軟體和科學計算應用最佳化首次實現了規模化的可能性。短期內,存量軟體的自動最佳化可帶來直接收益,已有的以Stencil為熱點的工業或科學軟體能在小時級生成接近硬體極限效能的運算元實現,節約算力、壓縮研發時間。長遠來看,Stencil運算元背後涵蓋CAE模擬、地震成像、電磁與流體計算等工業軟體,這些軟體效能最佳化實現自動化,將進一步加速國內製造業的發展。