7月24日,螞蟻百靈正式釋出新一代原生混合推理模型 Ling-3.0-Flash。該模型總引數量為 124B,但單次計算僅啟用 5.1B 引數,在大幅壓縮計算開銷的同時,在基礎推理、指令遵循及長文本處理等核心指標上,對標甚至超越了引數規模達其2至3倍的行業領先模型,展現出更高的“智效比”。
據瞭解,Ling-3.0-Flash 已上線 OpenRouter 平台,限時免費一週,之後將正式開源。這一發布節奏延續了螞蟻百靈在開源生態中的積極策略,旨在吸引開發者社群快速試用並反饋。
作為該版本的重點,Ling-3.0-Flash 針對 Agent 的實際應用場景進行了深度打磨。模型擴充套件了超過 10000 個真實互動訓練環境,並優化了複雜任務的自我糾錯與長程規劃機制。無論是在程式碼編寫、複雜任務拆解,還是多源資訊深度調研等場景中,Ling-3.0-Flash 均展現出更強的自主閉環交付能力,解決了傳統模型在大任務中容易“跑偏”或斷檔的難題。
實現“小體量、高智慧”的關鍵,源於模型底層計算架構的重新設計。Ling-3.0-Flash 放棄了單純堆砌引數的思路,從預訓練階段即採用混合注意力架構,以 5:1 的比例交替堆疊 KDA 線性注意力層與 MLA 層,讓模型在長上下文效率與模型能力之間實現更優平衡。
此外,Ling-3.0-Flash 將上一代的 Lightning Attention 升級為 KDA(Kimi Delta Attention),在 Delta Rule 的狀態更新中引入細粒度對角門控,讓模型在處理長文件和程式碼庫時能更精準地記住關鍵資訊。同時,模型進一步壓縮了單次計算的專家啟用比例,每個 Token 的專家啟用比例由前代的 1/32 進一步壓縮至 1/64,由此帶來了更高的“效率槓桿”。
為了讓 AI Agent 執行更快、更穩,百靈還為其匹配了配套的工程與協作架構。在響應速度上,通過引入叢集級分級快取,避免了長對話和多輪互動中的重複計算,將長輸入下的首字響應延遲降低了 60% 至 80% 以上;在任務穩定性上,升級後的多智慧體協同架構允許不同 Agent 分工協作、相互校驗,有效減少了單一模型的誤判風險,為高頻線上服務與真實業務落地提供了支撐。
Ling-3.0-Flash 的釋出,標誌著螞蟻百靈在高效模型架構與Agent落地能力上的重要進展。在當前AI產業追求“降本增效”的背景下,該模型以較低的計算成本實現高效能,有望在金融、客服、程式碼輔助等實際業務場景中發揮價值,同時也為行業探索“小模型大智慧”的路徑提供了新的參考。