智谱AI于今日发布GLM-5系列的首个原生多模态模型GLM-5.3-Flash。该模型总参数达320B,但激活参数仅18B,在多项基准测试和真实工作负载中表现优于前代GLM-5.2,而推理价格仅为后者的十分之一,在编码和智能体相关基准上接近Claude Opus 4.8的水平。

GLM-5.3-Flash基于全新训练的基座模型,其架构和训练方案围绕能力与效率重新设计。模型首次在GLM系列中引入稀疏与线性注意力混合架构,在保留精确长上下文能力的同时,大幅降低长上下文推理的服务成本。此外,模型采用流形约束超连接(mHC) 技术以提升扩展效率,并配合最新的30T token多模态预训练语料,实现用更少算力获得更强智能。

在部署方面,GLM-5.3-Flash支持SGLangvLLMTokenSpeedTransformersKTransformersUnsloth等主流推理框架,开发者可便捷地在本地运行。模型还支持通过reasoning_effort参数控制思考预算,提供低、高、最大三档,默认设为最大,以适应不同场景的推理需求。

此次发布延续了智谱在开源模型领域的激进策略。此前,GLM系列已在中文社区积累大量用户,此次Flash版本以低价高能定位,可能进一步压缩中小型模型厂商的生存空间,并推动多模态应用和智能体开发的普及。从产业角度看,GLM-5.3-Flash的低推理成本有望降低AI应用开发门槛,利好下游应用层创新,同时可能加剧头部模型厂商之间的价格战,对算力服务商和云厂商的定价策略产生影响。

值得注意的是,GLM-5.3-Flash在编码和智能体基准上的表现接近Claude Opus 4.8,这表明国产模型在复杂任务处理能力上正快速追赶国际领先水平。不过,实际效果仍需在真实业务场景中进一步验证。智谱表示,更多技术细节将随GLM-5技术报告发布,开发者可通过Z.ai API平台调用该模型的云端服务。