智谱 AI 于近日发布新一代开源大模型 GLM-5,目标直指复杂系统工程与长周期智能体任务。据官方介绍,GLM-5 在参数规模上从 GLM-4.5 的 355B(32B 激活)大幅扩展至 744B(40B 激活),预训练数据量也从 23T tokens 提升至 28.5T tokens。这一规模扩张延续了智谱“缩放仍是提升 AGI 智能效率的最重要途径之一”的技术路线。

值得注意的是,GLM-5 集成了 DeepSeek 稀疏注意力(DSA) 技术,这一设计在保留长上下文能力的同时,显著降低了部署成本。此外,智谱还开发了名为 slime 的异步强化学习基础设施,以解决大规模 LLM 强化学习训练效率低下的问题,从而实现更细粒度的后训练迭代。

在性能表现上,智谱官方公布了一系列基准测试结果,宣称 GLM-5 在推理、编程和智能体任务上均达到开源模型中的最佳水平,并缩小了与前沿闭源模型的差距。例如,在 Humanity's Last Exam (HLE) 测试中,GLM-5 取得 30.5 分,高于 GLM-4.7 的 24.8 分和 DeepSeek-V3.2 的 25.1 分,但低于 Kimi K2.5 的 31.5 分、GPT-5.2 (xhigh) 的 35.4 分以及 Gemini 3 Pro 的 37.2 分。在 AIME 2026 I 数学竞赛测试中,GLM-5 得分 92.7,与 GLM-4.7 持平,略低于 Claude Opus 4.5 的 93.3 分。

在编程能力方面,GLM-5 在 SWE-bench Verified 上获得 77.8 分,优于 GLM-4.7 的 73.8 分和 DeepSeek-V3.2 的 73.1 分,但低于 Claude Opus 4.5 的 80.9 分和 GPT-5.2 的 80.0 分。在智能体相关测试中,GLM-5 在 Terminal-Bench 2.0 上表现突出,得分 56.2(Terminus 2 框架)和 56.2(Claude Code 框架),远超 GLM-4.7 的 41.0 和 32.8 分。在 CyberGym 测试中,GLM-5 得分 43.2,显著高于 GLM-4.7 的 23.5 分,但低于 Claude Opus 4.5 的 50.6 分。

在工具调用与智能体交互方面,GLM-5 在 τ²-Bench 上得分 89.7,高于 GLM-4.7 的 87.4 分,但低于 Claude Opus 4.5 的 91.6 分和 Gemini 3 Pro 的 90.7 分。在 MCP-Atlas (Public Set) 上,GLM-5 得分 67.8,优于 GLM-4.7 的 52.0 分,但略低于 GPT-5.2 的 68.0 分。此外,在 Vending Bench 2 测试中,GLM-5 获得 $4,432.12 的收益,远高于 GLM-4.7 的 $2,376.82,但低于 Claude Opus 4.5 的 $4,967.06 和 Gemini 3 Pro 的 $5,478.16。

智谱官方表示,GLM-5 已可通过 Z.ai API 平台 使用,并支持本地部署,兼容 vLLM、SGLang、KTransformers 等主流开源框架。模型权重已在 Hugging Face 上开源,许可证为 MIT。

从产业视角看,GLM-5 的发布体现了开源模型在规模与能力上的持续追赶,其集成 DeepSeek 稀疏注意力技术也反映了行业在降低推理成本方面的探索。对于 AI 基础设施与模型层而言,这一进展可能加速智能体应用的落地,并推动相关算力需求的增长。不过,模型的实际表现仍需在真实场景中进一步验证。