阿里巴巴近日開源了其超大規模MoE(混合專家)模型Qwen3.8-2.4T-A95B,與此同時,智源研究院的Flag OS社群宣佈已完成該模型的Day0多晶片適配。這意味著,在模型釋出當天,開發者即可在包括平頭哥、輝達、摩爾線程、華為昇騰、沐曦、崑崙芯、海光、清微智慧、隧原在內的9家AI晶片上,基於Flag OS統一開源技術棧獲得開箱即用的部署方案。

據智源方面介紹,此次適配針對不同晶片提供了BF16、FP8、INT8等多種精度版本,並完成了精度對齊與部署驗證。Qwen3.8-2.4T-A95B是阿里巴巴開源系列中規模最大、能力最強的一代,首次將Qwen-Max級別的模型開放出來。該模型總引數達2.4萬億,啟用引數為95B,為純文本模型,在程式設計、專業工作、科研、長程智慧體任務等能力上顯著提升,支援通過reasoning_effort調節推理深度,並具備preserve_thinking以保留歷史推理。其原生上下文長度達262,144 tokens,可擴充套件至1,010,000,提供BF16/FP8權重,相容vLLM、SGLang等主流推理框架。

在Coding Agent相關基準測試中,Qwen3.8-Max相比前代Qwen3.7-Max有明顯提升:Terminal Bench 2.1得分從74.5升至86.6,SWE-bench Pro從60.6升至67.7,接近Opus 4.8的69.2;Paper Bench從64.8升至93.0,超過Opus 4.8的80.3。這些資料表明,新一代模型在程式碼智慧體任務上已具備與國際領先模型競爭的實力。

此次適配的核心挑戰在於模型引數規模比Qwen3.5-397B擴大了6倍。為了讓已部署的主流AI晶片能夠執行如此龐大的模型,Flag OS技術棧新增了面向多款AI晶片的統一INT8量化支援。通過Flag OS-Compressor多晶片模型量化工具鏈,團隊實現了從FP8/BF16原生權重到INT8的兩條量化壓縮路徑,並完成了量化推理運算元在多款晶片上的適配。經評測,量化遷移後的權重在多種AI晶片上與輝達原生CUDA FP8版本對照,誤差平均分偏差均在對齊區間內,保證了模型質量。

這一進展是Flag OS自今年2月首次開展MiniCPM4.5-o模型多晶片Day0適配以來的又一次實踐。截至目前,Flag OS已累計完成來自7大頭部模型團隊、12款主流開源模型、覆蓋多達10款晶片的跨芯Day0適配。這向AI晶片與大模型產業驗證了:基於統一、開放的系統軟體棧,實現前沿模型“一次開發、多芯快速適配”已具備規模化落地能力。

對國內雲廠商、智算中心和新興Token算力服務商而言,每次大模型釋出都意味著新的遷移與適配工作。不同晶片的適配鏈路相對獨立,往往需要重複投入大量工程資源。Flag OS的Day0適配將新模型從釋出到多芯可用的週期壓縮至24小時以內,使中小型算力服務商能夠基於國產晶片快速上線推理API和MaaS服務,無需維持完整的底層適配團隊。目前,騰訊雲HAI社群、超算網際網路等多個雲平台已將Flag OS適配的模型納入其容器映象中心,開發者可直接拉取映象部署至雲端加速卡,這表明Day0適配正從技術驗證走向雲服務交付。

此外,Flag OS還致力於讓存量算力持續承接前沿模型。通過量化、運算元最佳化和跨芯適配,Flag OS-Compressor已支援W8A8量化,將權重和啟用由BF16壓縮至INT8,顯著降低視訊記憶體佔用與訪存壓力,解決了當下80%以上存量AI算力不支援FP8的問題。針對不同代際的國產AI晶片,Flag OS進一步優化了量化後的權重規模、單卡視訊記憶體、卡數、記憶體頻寬及並行通訊方案,使存量算力有機會繼續執行最新的超大規模MoE模型。對智算中心等重資產場景而言,這有助於延長裝置服役週期、提高利用率,緩解因模型快速演進帶來的硬體更新壓力。智源方面強調,其目標並非讓舊硬體獲得與新一代硬體相同的效能,而是在部署條件、模型精度和效能表現均可驗證的前提下,為國產算力持續承接前沿模型提供可持續經濟的選擇。