螞蟻集團旗下百靈團隊於今日釋出了新一代原生混合推理模型 Ling-3.0-flash。該模型總引數量為 124B,啟用引數僅 5.1B,分別約為其前代 1T 級旗艦模型 Ring-2.6-1T 的 12.4% 和 8.1%,但在關鍵基準測試中表現持平或超越前代。這一“以小博大”的特性,使其在推理效率和部署成本上具備顯著優勢。
Ling-3.0-flash 採用原生混合線性架構,從預訓練之初便以 5:1 的比例交替堆疊 KDA(Kimi Delta Attention) 與 MLA 層,並引入 KDA 細粒度對角門控和 1/64 稀疏 MoE 技術。模型總層數為 35 層,其中包含 2 個稠密層,路由專家數為 512,啟用專家數為 8。這種設計旨在提升長上下文處理效率並降低計算成本。
在效率方面,Ling-3.0-flash 每個 token 僅啟用 5.1B 引數,卻提供了強大的推理、指令遵循和長上下文能力,可支撐生產環境中的複雜智慧體工作流。模型原生集成了 SGLang HiCache 與 Mooncake 分層快取架構,通過物理雙池和叢集共享的 L3 快取,消除了長互動過程中的冗餘重計算,在長輸入場景下將首 token 延遲(TTFT)降低了 60% 至 80% 以上。
針對智慧體任務,Ling-3.0-flash 在訓練中融入了超過 10,000 個互動式環境,實現了編碼、通用及深度研究等智慧體任務的端到端閉環執行。官方表示,該模型在 Claude Code、Kilo Code、Qwen Code、Hermes Agent 和 OpenClaw 等框架中均表現出良好的使用者體驗。
在評測方面,Ling-3.0-flash 在程式碼與智慧體基準測試中表現強勁,包括 SWE-Bench Pro、SWE-Bench Multilingual、Tau3-banking-AA、MCP-Atlas 和 SkillsBench 等。此外,該模型在通用知識、數學推理、指令遵循和長上下文理解方面也展現出較強實力。評測中,模型預設啟用思考模式,解碼引數為 temperature=0.6、top_p=0.95、top_k=20。
值得注意的是,Ling-3.0-flash 的釋出標誌著高效推理模型在效能與成本之間取得了新的平衡。對於 AI 產業而言,這類低啟用引數模型有望降低推理階段的算力需求,從而影響雲服務提供商的成本結構,並推動更廣泛的智慧體應用落地。不過,其實際表現仍需在真實生產環境中進一步驗證。