螞蟻百靈(inclusionAI)於 Hugging Face 釋出新一代原生混合推理模型 Ling-3.0-flash,總引數 124B、啟用引數僅 5.1B,約為其前代 1T 級旗艦 Ring-2.6-1T12.4%8.1%。官方稱,該模型在關鍵基準上匹配或超越前代,同時顯著提升長上下文處理效率與計算成本效益。

Ling-3.0-flash 採用原生混合線性架構,從預訓練開始即交替堆疊 KDA(Kimi Delta Attention)MLA,比例為 5:1,並引入 KDA 細粒度對角門控和 1/64 稀疏 MoE。模型共 35 層 KDA 與 7 層門控 MLA,包含 512 個路由專家和 1 個共享專家,每次啟用 8 個專家。這種設計旨在實現長上下文效率與計算成本的協同提升。

在效能方面,Ling-3.0-flash 啟用引數僅 5.1B,但官方稱其在推理、指令遵循和長上下文能力上表現突出,可支援生產環境中的複雜智慧體工作流。模型原生集成了 SGLang HiCacheMooncake 分層快取架構,具備物理雙池和叢集共享 L3 快取,可消除長時互動中的冗餘重計算,在長輸入場景下將首 token 延遲(TTFT)降低 60% 至 80% 以上

針對智慧體任務,Ling-3.0-flash 集成了 10,000+ 互動訓練環境,覆蓋編碼、通用和深度研究等任務,實現端到端閉環執行。官方在多個基準上進行了評估,包括 SWE-Bench ProSWE-Bench MultilingualTau3-banking-AAMCP-AtlasSkillsBench 等,並稱其在 Claude Code、Kilo Code、Qwen Code 等框架中提供良好體驗。此外,模型在通用知識、數學推理、指令遵循和長上下文理解方面也有不錯表現。

模型支援256K 上下文視窗,預設啟用思考模式,預設引數為 temperature=0.6、top_p=0.95、top_k=20。官方還提供了 FP8、INT4 和 FP4 等量化版本,其中 FP8 採用塊級量化,INT4/FP4 採用分組量化。

Ling-3.0-flash 的釋出體現了高效推理模型的發展趨勢:以更少的啟用引數實現接近旗艦模型的效能,有助於降低推理成本、提升部署效率,對 AI 應用的規模化落地具有積極意義。對於關注 AI 產業鏈的投資者而言,這類模型可能影響算力需求結構,推動更高效的推理最佳化方案。