智谱AI(Z.ai)于Hugging Face发布GLM-5系列首个原生多模态模型GLM-5.3-Flash。该模型总参数达320B,但激活参数仅18B,在多项基准测试和真实工作负载中超越前代GLM-5.2,同时推理成本降至前代的十分之一,在编码与智能体相关基准上接近Claude Opus 4.8的水平。

GLM-5.3-Flash基于全新训练的基座模型,其架构与训练方案围绕能力与效率重新设计。GLM系列首次引入稀疏与线性注意力混合架构,大幅降低长上下文服务成本,同时保持精确的长上下文能力。模型还采用Manifold-Constrained Hyper-Connections(mHC)技术以提升扩展效率。结合最新的30T token多模态预训练语料,GLM-5.3-Flash实现了用更少算力获得更强智能。

该模型支持通过SGLangvLLMTokenSpeedTransformersKTransformersUnsloth等框架进行本地部署,并可通过Z.ai API平台调用服务。GLM-5.3-Flash支持通过`reasoning_effort`参数控制思考预算,提供`low`、`high`、`max`三档,默认`max`;聊天场景建议显式设置`clear_thinking=true`。

在评测方面,GLM-5.3-Flash在多个基准上采用严格设置,例如HLE with tools使用最大生成长度163,840 tokens、最大上下文300,000 tokens,并以GPT-5.6-luna作为裁判模型;NL2Repo在1M上下文下评估;DeepSWE使用mini-swe-agent harness,超时6小时,上下文400K;Terminal-Bench 2.1在Claude Code 2.1.207中评估。Agent’s Last ExamToolathlon Verified结果均通过官方评测服务获得,报告pass@1在3次独立运行中取平均。此外,GDPval-AA v2由Artificial Analysis评估,BabyVision使用温度1.0、top_p 0.95,最大上下文164K tokens。

智谱AI在模型层持续发力,GLM-5.3-Flash的发布标志着其在多模态与效率优化上的新进展。混合注意力架构和mHC技术的引入,可能为长上下文应用带来更经济的推理方案,对依赖大规模AI服务的开发者和企业而言,成本下降意味着更低的准入门槛。同时,接近Claude Opus 4.8的编码与智能体表现,表明国产模型在复杂任务上正逐步缩小与海外领先模型的差距。

从产业角度看,GLM-5.3-Flash的低激活参数设计(18B)体现了对推理效率的重视,这可能影响模型层竞争格局——在算力成本高企的背景下,高效模型更易获得开发者青睐。此外,模型支持本地部署与API两种方式,兼顾了数据隐私与易用性需求。随着GLM系列持续迭代,智谱AI在AI产业链模型层的地位有望进一步巩固,其技术路线或为行业提供参考。