螞蟻集團旗下 inclusionAI 於近日釋出了 Ling-3.0-tiny,一款主打輕量級部署的原生混合推理模型。該模型總引數為 7.9B,但在推理時僅啟用 1.3B 引數,旨在降低推理所需的計算資源,並推動模型在本地和邊緣裝置上的應用。
Ling-3.0-tiny 採用了與 Ling-3.0 系列一脈相承的混合線性注意力架構,具體為 3:1 的 KDA(Kimi Delta Attention)與 MLA(Multi-Head Latent Attention)交替堆疊,即每四層中包含三層 KDA 和一層 MLA。這種設計旨在提升長上下文處理效率。同時,模型集成了包含 128 個路由專家的稀疏 MoE(混合專家)結構,每個 token 僅啟用其中 8 個路由專家和 1 個共享專家,從而在保持較強能力的同時,將啟用引數控制在較低水平。
該模型的一個核心特點是支援原生混合推理,即能夠根據請求內容在快速響應和深度多步推理之間靈活切換。開發者可通過 `enable_thinking` 引數按請求配置思考模式,這使其在通用智慧體任務、工具呼叫、數學與科學推理以及指令遵循等場景中表現均衡。
為適應不同部署環境,Ling-3.0-tiny 提供了 BF16、FP8 和 INT4 三種精度版本。其中 BF16 適用於高精度評估,FP8 可在吞吐與資源佔用間取得平衡,而 INT4 則面向資源受限的邊緣裝置。這種多精度策略降低了開發者根據硬體條件進行選擇的門檻。
在效能評測方面,Ling-3.0-tiny 在 Artificial Analysis Intelligence Index v4.1.1 上得分為 25,在 Artificial Analysis Agentic Index 上得分為 16。據 Artificial Analysis 測試,該模型輸出速度超過 160 tokens/s,生成 500 tokens 的端到端延遲約為 18 秒(包含推理模型的思考時間),顯示出在能力、啟用引數規模與響應效率之間的平衡。
從產業視角看,Ling-3.0-tiny 的釋出體現了當前 AI 模型發展的一個重要趨勢:在追求效能的同時,越來越注重推理效率與部署靈活性。對於 AI 產業鏈而言,這類輕量級模型有助於降低推理成本,使更多應用場景能夠負擔得起 AI 能力,尤其是在資源受限的本地或邊緣環境中。這可能對算力需求結構產生影響,推動市場對高效推理晶片和最佳化部署方案的需求。
螞蟻集團通過 inclusionAI 推出該模型,也反映了國內科技公司在開源模型領域的持續投入。Ling-3.0-tiny 已上線 Hugging Face、ModelScope 和 OpenRouter 等平台,採用 MIT 許可,開發者可自由使用和修改。隨著此類模型的普及,AI 應用有望從雲端向邊緣延伸,為智慧終端、物聯網裝置等帶來更即時的智慧體驗。