智谱AI(Z.ai)于今日在Hugging Face平台发布了GLM-5.3-Flash,这是GLM-5系列中首个原生多模态模型。该模型总参数规模达320B,但激活参数仅18B,官方宣称其在基准测试和真实工作负载中性能超越前代GLM-5.2,而价格仅为后者的十分之一,在编码和智能体(agentic)基准上接近Claude Opus 4.8的水平。
GLM-5.3-Flash基于全新训练的基座模型构建,其架构和训练方案围绕能力与效率重新设计。官方介绍,这是GLM系列首次引入稀疏注意力与线性注意力混合架构,显著降低长上下文推理成本,同时保持精确的长上下文能力。模型还采用了Manifold-Constrained Hyper-Connections (mHC) 技术以提升扩展效率。配合最新的30T token多模态预训练语料,这些改进使模型能够以更少的算力提供更强的智能。
在部署方面,GLM-5.3-Flash支持多种主流推理框架,包括SGLang、vLLM、TokenSpeed和KTransformers,方便开发者本地部署。模型采用MIT许可证,支持中英文,Hugging Face页面显示其参数规模为321B(含嵌入等),更新于31分钟前。
从产业角度看,GLM-5.3-Flash的发布延续了智谱在高效模型路线上的探索。以18B激活参数实现接近顶尖闭源模型的性能,并大幅降低推理成本,这可能在模型层引发新的价格竞争,尤其对依赖API调用的应用开发者具有吸引力。同时,混合注意力架构的引入也反映了行业对降低长上下文推理成本的普遍关注,这对基础设施层的算力调度和成本优化具有参考意义。
不过,官方公布的基准成绩(如HLE、NL2Repo、DeepSWE等)均基于特定评测设置,实际表现仍需独立验证。智谱在技术报告中详细列出了评测方法,包括使用GPT-5.6-luna作为裁判模型等,显示其试图提高评测透明度。对于投资者而言,该模型的成本优势可能影响智谱API的定价策略,进而影响其商业化进程,但具体市场反应尚待观察。