螞蟻集團旗下inclusionAI於近日在Hugging Face等平台釋出了新一代原生混合推理模型Ling-3.0-flash。該模型總引數量為124B,但啟用引數僅5.1B,分別約為其前代旗艦模型Ring-2.6-1T的12.4%和8.1%。官方表示,Ling-3.0-flash在關鍵基準測試中匹配或超越了前代產品,同時大幅提升了計算效率和長上下文處理能力。

Ling-3.0-flash採用了原生混合線性注意力架構,從預訓練之初即採用5:1交替堆疊的Kimi Delta Attention(KDA)MLA結構,並升級了KDA的細粒度對角門控和1/64稀疏MoE。模型總引數量124B,啟用引數5.1B,包含35層KDA和7層門控MLA,以及2個稠密層、512個路由專家和1個共享專家,每次啟用8個專家。這種設計旨在實現長上下文效率與計算成本的協同提升。

在效率方面,Ling-3.0-flash每token僅啟用5.1B引數,卻提供了強大的推理、指令跟隨和長上下文能力,官方稱其效能可媲美更大規模的SOTA模型和前代旗艦。模型專為生產環境中的複雜智慧體工作流設計,集成了SGLang HiCacheMooncake分層快取架構,通過物理雙池和叢集共享L3快取,消除了長互動過程中的冗餘重計算,在長輸入場景下將首Token延遲(TTFT)降低60%至80%以上

針對智慧體任務,Ling-3.0-flash整合了10,000多個互動式訓練環境,實現編碼、通用和深度研究等智慧體任務的端到端閉環執行。官方在多個權威基準上進行了評估,包括SWE-Bench ProSWE-Bench MultilingualTau3-banking-AAMCP-AtlasSkillsBench等,模型在這些程式碼與智慧體基準上表現強勁。此外,模型在Claude Code、Kilo Code、Qwen Code、Hermes Agent和OpenClaw等框架中均提供了良好的使用者體驗。

除智慧體任務外,Ling-3.0-flash在通用知識、數學推理、指令跟隨和長上下文理解方面也表現優異。模型預設啟用思考模式,預設引數為temperature=0.6、top_p=0.95、top_k=20。上下文訓練計劃覆蓋8K至256K長度。

Ling-3.0-flash的釋出體現了AI模型向高效、低成本推理方向發展的趨勢。通過極低的啟用引數實現高效能,有助於降低推理成本,使複雜AI應用在生產環境中更易部署。該模型對依賴大規模算力的基礎設施層和追求成本效益的模型層均有潛在影響,可能推動更多企業採用類似的高效架構。目前模型已在Hugging Face、ModelScope和OpenRouter等平台開放,採用MIT許可。