阿里平頭哥在亮出被其稱為“中國最強AI晶片”的真武系列後,緊接著把重心轉向軟體生態。9月23日,平頭哥公佈了AI軟體棧T-Head SAIL的最新開源進展,進一步擴大在框架適配、加速庫、工具鏈和通訊庫等領域的開放範圍。按照平頭哥的比喻,AI晶片是發動機,軟體棧則相當於“變速箱+傳動系統+駕駛系統”。

SAIL全稱為Seed of AI Library,可以理解為平頭哥圍繞真武AI晶片打造的一套類“CUDA”軟體棧。它連線PyTorch等上層AI框架和底層真武硬體,負責模型遷移、編譯執行、計算加速和開發除錯。今年7月WAIC上,平頭哥宣佈啟動T-Head SAIL開源,並向開發者提供SDK、驅動、效能分析與除錯工具以及技術文件的下載。兩個多月後的雲棲大會上,團隊公佈了進一步的開源進展。

已開源的專案包括PyTorch-for-sail框架適配、sailify原始碼遷移工具、Triton-for-sail運算元開發工具,以及DeepGEMM-for-sail、FlashAttention-for-sail等計算加速專案。從除錯工具、技術文件到開源框架,隨著更多工具和資源開放,開發者能夠深入瞭解軟體的具體實現,並根據業務需要檢視、修改程式碼。

平頭哥半導體軟體生態資深總監陸生華在公開演講中表示,從業務角度看,客戶最大的訴求就是遷移成本有多大。這並不難理解:不少客戶的軟體已經在線上執行多年,程式碼反覆修改,工具早已用順手,團隊也積累了自己的調優經驗。框架適配、原始碼遷移和運算元開發工具,首先要做的就是儘可能保留這些積累,讓開發者繼續沿用熟悉的模型開發方式,由遷移工具輔助處理已有程式碼,再根據新硬體特點完成必要適配。

但遷移跑通只是第一步。如果換了晶片之後效率只剩原來的30%到40%,即便模型能跑起來,實際業務也很難接受。於是第二個問題隨之而來:同一個模型能不能跑得更快、資源還能不能再省一點?這時候,只靠廠商把工具做好還不夠,DeepGEMM-for-sail、FlashAttention-for-sail這類計算加速專案開源的意義就顯現出來。開發者不只是下載現成工具,還可以直接看到內部實現,再根據自己的模型和業務負載繼續修改。過去需要交回晶片廠商的問題,現在業務團隊有機會自己定位、自己最佳化。

模型更新節奏如今基本是幾週一更。如果適配慢了一輪,業務團隊嘗試新技術的時間也會推遲。儘快支援新模型、甚至做到Day 0可用,已成為客戶對算力平台的期待。平頭哥也在持續提供面向真武適配的模型資源。按照現場演講披露的資料,截至2026年9月,其在ModelScope上已提供39個量化模型,覆蓋Qwen、DeepSeek、Kimi等系列,累計下載超過34.8萬次。與此同時,TensorFlow、JAX適配版本、自研推理引擎,以及PCCL、DeepEP-for-sail等通訊元件和除錯監控工具,也還在推進開源。

客戶側的使用案例正在增多。小鵬將原先執行在GPU平台上的業務模型遷到真武雲端叢集,開展智慧駕駛模型訓練,遷移後繼續利用SAIL的效能分析工具定位訓練瓶頸,再圍繞運算元和框架進行最佳化。SAIL支援C++、Triton、TileLang等開發方式,目的是減少重新學習的負擔。螞蟻集團推理服務團隊已基於SAIL,在真武810E和M890上完成主要前沿模型的推理適配,接下來量化、推理階段分離、專家並行負載均衡、稀疏注意力接入等工作仍在繼續。小紅書則基於SAIL開原始碼,面向真武架構開發了模型遷移與運算元最佳化Agent,用自動化方式輔助最佳化,加速生成式推薦模型的部署上線。

這些案例背後有一個共同邏輯:客戶可以把自己的模型經驗和業務需求寫進工具,形成適合自身場景的最佳化方法,廠商提供的基礎實現成為下一輪開發的起點。客戶想針對晶片開發高效能運算元,往往又需要保護自己的演算法和智慧財產權。開放軟體程式碼和架構資訊後,客戶就有條件自己完成這項工作,核心業務邏輯留在內部,願意公開的工具和最佳化則提交給社群。T-Head SAIL為此建立了貢獻流程:開發者可以提出問題、修改程式碼、提交貢獻,經過自動化測試和維護者、社群評審後,改進可以合入主線,隨版本釋出。

平頭哥收到的反饋也相當具體:有人希望把自己的專案貢獻出來,有人需要更多硬體架構資訊以便開發定製運算元,還有人希望新模型、新框架得到更快支援。真武的架構資訊已經公開,社群治理和貢獻規則仍在完善;團隊正推動軟體元件解耦釋出,讓不同專案能夠分別更新,並將面向真武的適配成果逐步提交回上游社群。

要理解這個時間點,得先回到晶片本身。從2019年的含光800,到2021年的倚天710,再到如今的真武系列,平頭哥走了多年。其中一條持續的路徑,是從業務需求出發設計晶片,先在阿里內部驗證,再通過雲等方式服務外部客戶。淘寶、搜尋、推薦、廣告等業務承擔了早期生產驗證的角色,經過實際流量和叢集穩定性的考驗,產品再逐步向外推廣。到真武M890,團隊已經完成兩代完整晶片交付。在陸生華看來,軟體的成熟度和客戶對二次開發的需求,共同促成了此時的開放。

汽車企業訓練模型、網際網路企業最佳化推薦、模型團隊嘗試新演算法,各自的計算方式和效能瓶頸並不相同。同一套基礎軟體之上,還會有大量貼近具體業務的開發。客戶越多,把這些工作全部留給晶片廠商就越難持續。這時擴大開放,既有經過驗證的軟體可以拿出來,也有真正需要它、願意繼續開發的使用者。晶片廠商基於主流框架做適配,通常需要修改一部分程式碼。如果長期維護自己的獨立版本,上游每次更新都要重新同步程式碼、處理差異、測試驗證,獨立版本和上游分開的時間越長,這項工作就越重。把適配和最佳化提交回PyTorch、vLLM、Triton等上游社群,是為了讓真武的支援能夠隨主流軟體一起演進。

當然,程式碼開放之後,廠商的工作仍然要繼續。原先統一發布的軟體包拆成多個獨立元件,需要新的檢查和測試安排;社群提交的改動,也需要有人評審、維護並對產品質量負責。開放能擴大參與範圍,也要求平頭哥建立長期協作的能力。

更宏觀的背景是,早在2025年2月,阿里就宣佈了三年內至少投入3800億元建設雲和AI基礎設施的計劃,隨後又提出將在這一計劃上進一步增加投入。模型帶來新的演算法、計算精度和並行需求,晶片提供計算、記憶體和互聯能力。SAIL通過編譯器、運算元庫和通訊庫,讓模型的這些需求在硬體上得到實現,再由雲將整套計算能力組織成服務交付給使用者。這層軟體能否及時跟上,影響著新模型能多快用上硬體的效能,也影響著雲上業務的執行效率。

阿里內部已經在做這種協同。按照陸生華的介紹,平頭哥正在與千問團隊合作,探索讓模型生成高效能運算元。生成一段功能正確的程式碼相對容易,要讓它充分發揮晶片效能,還需要模型理解底層架構。但千問的需求無法涵蓋所有行業,小紅書的生成式推薦、小鵬的智慧駕駛訓練,各有自己的模型、資料和最佳化目標。T-Head SAIL進一步開放,是讓這些團隊也能參與連線模型與硬體的軟體開發,把對業務的理解轉化為具體實現。

總體來看,阿里在模型、晶片和雲上的持續投入,最終要由更多業務來檢驗。晶片交付之後,軟體能否持續跟上、客戶能否按自己的需求開發,都會影響這些投入最終能服務多廣的市場。平頭哥用多年投入積累了造芯和用芯的能力,走到今天,它開始把更多經過業務驗證的程式碼和工具交到開發者手中。晶片已經進入真實業務,接下來,就是這些“種子”在更多開發者手裡長出工具、最佳化和應用的過程。