螞蟻集團旗下百靈(inclusionAI)於今日釋出輕量級混合推理模型 Ling-3.0-tiny,該模型總引數為 7.9B,但每個token僅啟用 1.3B 引數,旨在以較低推理成本提供強大的推理與智慧體能力,使先進模型能力更易於本地及資源受限環境部署。模型已在Hugging Face、ModelScope和OpenRouter等平台上線,並提供BF16、FP8和INT4多種精度權重,適配廣泛硬體與部署場景。

Ling-3.0-tiny繼承了Ling-3.0系列的混合線性注意力架構,並針對輕量化和易部署進行了最佳化。其架構採用 3:1 的KDA與MLA交替堆疊(每4層中包含3層Kimi Delta Attention和1層Multi-Head Latent Attention),配合包含 128個路由專家 的稀疏MoE FFN,每個token僅啟用8個路由專家和1個共享專家,從而在長上下文建模、引數效率和計算成本之間取得平衡。模型原生支援混合推理,可通過 `enable_thinking` 引數按請求配置思考模式,既能快速響應常規任務,也能進行多步推理,適用於通用智慧體任務、程式設計、數學與科學推理及指令遵循等場景。

在效能驗證方面,Ling-3.0-tiny已在 NVIDIA DGX SparkApple Silicon MacBookMac mini 上完成驗證,無需資料中心級GPU即可執行推理與智慧體工作負載。在FP8精度下,模型在DGX Spark上可達到約 100-105 tokens/s 的生成速度,在M4 Pro MacBook上為 86-90 tokens/s,8K上下文時峰值記憶體佔用約 8.34 GiB。在Artificial Analysis測試中,模型輸出速度超過 160 tokens/s,生成500 token響應(含推理時間)的端到端延遲約 18秒。在Artificial Analysis Intelligence Index v4.1.1上得分為 25,Agentic Index得分為 16

模型支援通過SGLang和vLLM進行部署,並提供了針對低延遲、高吞吐等場景的啟動配置。推薦取樣引數為 temperature=1.0、top_p=0.95、top_k=20,思考模式預設開啟。在SGLang中,模型可在單塊141GB級GPU(如H20-3e)或單GPU Blackwell節點上執行,支援256K上下文長度,並內建MTP/NEXTN推測解碼以提升效率。vLLM支援則通過專門的程式碼分支提供。

Ling-3.0-tiny的釋出體現了螞蟻百靈在輕量級模型方向的佈局,其低啟用引數和高效推理特性,有望降低AI應用在本地和邊緣裝置的部署門檻,推動智慧體工作流在更廣泛場景中的落地。對於AI產業鏈而言,這類模型的推出可能影響推理成本結構,並促進端側AI應用的創新。