7月24日,蚂蚁百灵正式发布新一代原生混合推理模型Ling-3.0-flash。该模型总参数量为124B,但激活参数量仅5.1B,采用1/64稀疏MoE架构,每次推理只调用最相关的少数专家,将算力精准投放到当前任务。在12项基准测试中,Ling-3.0-flash有11项表现优于蚂蚁百灵5月开源的万亿级旗舰思考模型Ring-2.6-1T,后者总参数约1T、激活参数约63B。在34个评测维度中,Ling-3.0-flash拿下15个第一、19个第二,综合均分与DeepSeek-V4-Flash并列第一,领先Ring-2.6-1T近8分。蚂蚁百灵同步提出智能密度(均分/总参数量)与智效比(均分/激活参数量)两项新指标,Ling-3.0-flash分别以0.5和13.2在可比模型中双双登顶,几乎用最少参数撬动最高性能。
在代码能力方面,Ling-3.0-flash在SWE-Bench Pro测试中以56.6%的得分位居参测模型第一;在一次性生成完整交互式组件的ArtifactsBench中,其77.0%的得分断层领先,高出第二名10余分。MiniAppBench要求模型根据一句话需求生成完整APP,在16个主流模型平均仅17%通过率的硬核测试中,Ling-3.0-flash达到25.3%,与总参数约两倍的开源SOTA模型处于同等水平。
通用Agent能力方面,BFCL-v4函数调用评测中,Ling-3.0-flash以73.0%的准确率与Claude-Sonnet-4.6并列第一。在端到端综合Agent评测GDPVal v2-AA中,Ling-3.0-flash以1107分的成绩拔得头筹。Tau3-banking-AA将模型置于模拟银行系统中完成金融操作,其28.0%的得分仅次于Claude-Sonnet-4.6。搜索Agent能力上,WideSearch测试中模型以73.6%排名第三;在多智能体协作模式下,BrowseComp测试达到82.0%,与Claude-Sonnet-4.6的82.1%基本持平。
指令遵循能力方面,IFBench检验模型对格式、角色、语气等多重约束指令的遵循程度,Ling-3.0-flash得分74.5%,排名第三。LIFEBench测试多轮对话中的长期指令记忆与遵循能力,Ling-3.0-flash以77.3%位列第一。推理能力上,在高难度数学竞赛测试中表现基本与主流模型持平;在专家级跨学科知识推理测试HLE中,依然领先Ring-2.6-1T。长上下文能力得益于原生支持256K上下文窗口,在MRCR_256K测试中取得81.1%,在同等规模模型中表现优异;Multi-IF测试多轮对话中持续遵循跨轮指令的能力,以87.7%位列第二。
Ling-3.0-flash的架构创新在于从预训练阶段即采用原生混合线性注意力架构,以5:1的比例交替堆叠KDA(Kimi Delta Attention)线性注意力层与MLA(Multi-head Latent Attention)层。KDA在Delta Rule的状态更新中引入细粒度对角门控,赋予不同特征通道独立的保留、衰减与写入控制能力,让模型在处理长文档和大型代码库时能更精准地记住跨段落的关键信息。MLA则通过低秩压缩将KV Cache大幅缩减,降低推理时的显存占用。两者协同,使模型在长上下文效率、状态记忆与计算成本之间实现跃升。
百灵团队提出的Ling Scaling Law认为,更低的专家激活比例带来更高的效率杠杆。Ling-3.0-flash将每个Token的专家激活比例由前代的1/32压缩至1/64,通过更精细的专家路由策略,让每个Token只调动最相关的少数专家。此外,模型接入了SGLang HiCache与Mooncake分级缓存体系(物理双池、集群共享L3),借鉴现代CPU的三级缓存设计理念,将GPU内存、主机内存与分布式存储分别组织为L1、L2、L3三级缓存。长对话和多轮交互中,已计算过的KV Cache可被复用,实测数据显示长输入场景下的首字响应时间(TTFT)降低60%至80%以上。
在任务稳定性上,百灵升级了多智能体协同架构Ling Multi-Agent,各Agent通过分工协作、相互校验,有效减少单一模型在长程任务中容易跑偏或误判的风险。这套架构让Ling-3.0-flash从单点执行器升级为可支撑多角色协同的作战平台。
Ling-3.0-flash在OpenRouter与百灵官方平台同步开放限时免费API调用,免费期截至8月3日23:00,模型权重将在免费期结束后正式开源。在Token调用量排行中,Ling-3.0-flash自发布起5天内从第9位跃升至第6位,7月29日的调用量仅比DeepSeek V4 Pro低0.5%。蚂蚁百灵5月已开源万亿级Ling-2.6-1T、Ring-2.6-1T、Ling-2.6-flash,此次Ling-3.0-flash的发布进一步加速了其开源节奏,将轻量化高性价比的技术路线推向新阶段。在高并发、低延迟的Agent商用场景下,依托约1/12激活算力即可逼近旗舰模型表现,有效降低企业推理开销。