7月24日,螞蟻百靈正式釋出新一代原生混合推理模型Ling-3.0-flash。該模型總引數量為124B,但啟用引數量僅5.1B,採用1/64稀疏MoE架構,每次推理只調用最相關的少數專家,將算力精準投放到當前任務。在12項基準測試中,Ling-3.0-flash有11項表現優於螞蟻百靈5月開源的萬億級旗艦思考模型Ring-2.6-1T,後者總引數約1T、啟用引數約63B。在34個評測維度中,Ling-3.0-flash拿下15個第一、19個第二,綜合均分與DeepSeek-V4-Flash並列第一,領先Ring-2.6-1T近8分。螞蟻百靈同步提出智慧密度(均分/總引數量)與智效比(均分/啟用引數量)兩項新指標,Ling-3.0-flash分別以0.5和13.2在可比模型中雙雙登頂,幾乎用最少引數撬動最高效能。
在程式碼能力方面,Ling-3.0-flash在SWE-Bench Pro測試中以56.6%的得分位居參測模型第一;在一次性生成完整互動式元件的ArtifactsBench中,其77.0%的得分斷層領先,高出第二名10餘分。MiniAppBench要求模型根據一句話需求生成完整APP,在16個主流模型平均僅17%通過率的硬核測試中,Ling-3.0-flash達到25.3%,與總引數約兩倍的開源SOTA模型處於同等水平。
通用Agent能力方面,BFCL-v4函式呼叫評測中,Ling-3.0-flash以73.0%的準確率與Claude-Sonnet-4.6並列第一。在端到端綜合Agent評測GDPVal v2-AA中,Ling-3.0-flash以1107分的成績拔得頭籌。Tau3-banking-AA將模型置於模擬銀行系統中完成金融操作,其28.0%的得分僅次於Claude-Sonnet-4.6。搜尋Agent能力上,WideSearch測試中模型以73.6%排名第三;在多智慧體協作模式下,BrowseComp測試達到82.0%,與Claude-Sonnet-4.6的82.1%基本持平。
指令遵循能力方面,IFBench檢驗模型對格式、角色、語氣等多重約束指令的遵循程度,Ling-3.0-flash得分74.5%,排名第三。LIFEBench測試多輪對話中的長期指令記憶與遵循能力,Ling-3.0-flash以77.3%位列第一。推理能力上,在高難度數學競賽測試中表現基本與主流模型持平;在專家級跨學科知識推理測試HLE中,依然領先Ring-2.6-1T。長上下文能力得益於原生支援256K上下文視窗,在MRCR_256K測試中取得81.1%,在同等規模模型中表現優異;Multi-IF測試多輪對話中持續遵循跨輪指令的能力,以87.7%位列第二。
Ling-3.0-flash的架構創新在於從預訓練階段即採用原生混合線性注意力架構,以5:1的比例交替堆疊KDA(Kimi Delta Attention)線性注意力層與MLA(Multi-head Latent Attention)層。KDA在Delta Rule的狀態更新中引入細粒度對角門控,賦予不同特徵通道獨立的保留、衰減與寫入控制能力,讓模型在處理長文件和大型程式碼庫時能更精準地記住跨段落的關鍵資訊。MLA則通過低秩壓縮將KV Cache大幅縮減,降低推理時的視訊記憶體佔用。兩者協同,使模型在長上下文效率、狀態記憶與計算成本之間實現躍升。
百靈團隊提出的Ling Scaling Law認為,更低的專家啟用比例帶來更高的效率槓桿。Ling-3.0-flash將每個Token的專家啟用比例由前代的1/32壓縮至1/64,通過更精細的專家路由策略,讓每個Token只調動最相關的少數專家。此外,模型接入了SGLang HiCache與Mooncake分級快取體系(物理雙池、叢集共享L3),借鑑現代CPU的三級快取設計理念,將GPU記憶體、主機記憶體與分散式儲存分別組織為L1、L2、L3三級快取。長對話和多輪互動中,已計算過的KV Cache可被複用,實測資料顯示長輸入場景下的首字響應時間(TTFT)降低60%至80%以上。
在任務穩定性上,百靈升級了多智慧體協同架構Ling Multi-Agent,各Agent通過分工協作、相互校驗,有效減少單一模型在長程任務中容易跑偏或誤判的風險。這套架構讓Ling-3.0-flash從單點執行器升級為可支撐多角色協同的作戰平台。
Ling-3.0-flash在OpenRouter與百靈官方平台同步開放限時免費API呼叫,免費期截至8月3日23:00,模型權重將在免費期結束後正式開源。在Token呼叫量排行中,Ling-3.0-flash自發布起5天內從第9位躍升至第6位,7月29日的呼叫量僅比DeepSeek V4 Pro低0.5%。螞蟻百靈5月已開源萬億級Ling-2.6-1T、Ring-2.6-1T、Ling-2.6-flash,此次Ling-3.0-flash的釋出進一步加速了其開源節奏,將輕量化高性價比的技術路線推向新階段。在高併發、低延遲的Agent商用場景下,依託約1/12啟用算力即可逼近旗艦模型表現,有效降低企業推理開銷。