螞蟻集團旗下百靈(inclusionAI)今日在 Hugging Face 等平台開源了 Ling-3.0 系列語言基礎模型,主打高效與稀疏 MoE 架構,並同步釋出訓練過程中的多個檢查點,以支援社群研究與二次開發。其中旗艦基礎模型 Ling-3.0-flash-base 總引數達 124B,但每個 token 僅啟用 5.1B 引數,顯著降低了推理時的計算開銷。

Ling-3.0 系列採用高度稀疏的 MoE 架構,共設 512 個路由專家,每個 token 僅啟用其中 8 個路由專家1 個共享專家,從而在保持模型能力的同時大幅減少啟用引數。此外,該系列從預訓練之初就原生採用混合線性注意力架構,結合 KDA 與 Gated MLA,以高效處理長上下文輸入。這種設計有望在長文本任務中降低計算複雜度,提升推理效率。

除了最終的基礎模型,百靈還發布了訓練過程中的多個檢查點,包括預訓練檢查點、中期訓練檢查點以及經過 WSM 合併(即學習率衰減替代方案)的合併檢查點。這些檢查點分別對應訓練的不同階段,旨在支援繼續預訓練、微調、偏好最佳化、蒸餾研究以及長上下文和 MoE 系統研究。值得注意的是,Ling-3.0-tiny-base 與 Ling-3.0-flash-base 共享相同的訓練配方,社群可以先在小模型上實驗,再將驗證過的訓練策略擴充套件到更大模型,實現無縫規模擴充套件。

在模型規格上,Ling-3.0-flash-base 包含 35 層 KDA7 層 Gated MLA(比例為 5:1),隱藏層大小 2560,專家中間尺寸 768,詞表大小 157,184。模型以 MIT 許可 開源,允許自由使用、修改和分發,這為研究者和開發者提供了極大的靈活性。

百靈在釋出說明中強調,這些基礎模型適合用於繼續預訓練、中期訓練、監督微調、偏好最佳化、蒸餾研究等場景,但不建議直接用於面向終端使用者的聊天部署,也不建議在未進行額外對齊和評估的情況下用於安全關鍵應用。這反映出開源基礎模型與後訓練模型之間的明確分工,後訓練版本(如 Ling-3.0-tiny 和 Ling-3.0-flash)可能更適合實際應用。

從產業視角看,Ling-3.0 系列的開源對 AI 模型層和基礎設施層都有潛在影響。高效 MoE 架構與線性注意力的結合,有望降低推理成本,使中小企業和研究者能夠以更低門檻部署大模型,這可能加劇開源模型與閉源模型的競爭。同時,螞蟻集團作為中國科技巨頭,其開源動作也體現了國內大模型生態的活躍度,對關注 AI 產業鏈的投資者而言,這標誌著模型層技術路線多樣化和成本下降的趨勢。不過,模型的實際效能與生態採用情況仍需後續評估。