智譜 AI 於近日釋出新一代開源大模型 GLM-5,目標直指複雜系統工程與長週期智慧體任務。據官方介紹,GLM-5 在引數規模上從 GLM-4.5 的 355B(32B 啟用)大幅擴充套件至 744B(40B 啟用),預訓練資料量也從 23T tokens 提升至 28.5T tokens。這一規模擴張延續了智譜“縮放仍是提升 AGI 智慧效率的最重要途徑之一”的技術路線。

值得注意的是,GLM-5 集成了 DeepSeek 稀疏注意力(DSA) 技術,這一設計在保留長上下文能力的同時,顯著降低了部署成本。此外,智譜還開發了名為 slime 的非同步強化學習基礎設施,以解決大規模 LLM 強化學習訓練效率低下的問題,從而實現更細粒度的後訓練迭代。

在效能表現上,智譜官方公佈了一系列基準測試結果,宣稱 GLM-5 在推理、程式設計和智慧體任務上均達到開源模型中的最佳水平,並縮小了與前沿閉源模型的差距。例如,在 Humanity's Last Exam (HLE) 測試中,GLM-5 取得 30.5 分,高於 GLM-4.7 的 24.8 分和 DeepSeek-V3.2 的 25.1 分,但低於 Kimi K2.5 的 31.5 分、GPT-5.2 (xhigh) 的 35.4 分以及 Gemini 3 Pro 的 37.2 分。在 AIME 2026 I 數學競賽測試中,GLM-5 得分 92.7,與 GLM-4.7 持平,略低於 Claude Opus 4.5 的 93.3 分。

在程式設計能力方面,GLM-5 在 SWE-bench Verified 上獲得 77.8 分,優於 GLM-4.7 的 73.8 分和 DeepSeek-V3.2 的 73.1 分,但低於 Claude Opus 4.5 的 80.9 分和 GPT-5.2 的 80.0 分。在智慧體相關測試中,GLM-5 在 Terminal-Bench 2.0 上表現突出,得分 56.2(Terminus 2 框架)和 56.2(Claude Code 框架),遠超 GLM-4.7 的 41.0 和 32.8 分。在 CyberGym 測試中,GLM-5 得分 43.2,顯著高於 GLM-4.7 的 23.5 分,但低於 Claude Opus 4.5 的 50.6 分。

在工具呼叫與智慧體互動方面,GLM-5 在 τ²-Bench 上得分 89.7,高於 GLM-4.7 的 87.4 分,但低於 Claude Opus 4.5 的 91.6 分和 Gemini 3 Pro 的 90.7 分。在 MCP-Atlas (Public Set) 上,GLM-5 得分 67.8,優於 GLM-4.7 的 52.0 分,但略低於 GPT-5.2 的 68.0 分。此外,在 Vending Bench 2 測試中,GLM-5 獲得 $4,432.12 的收益,遠高於 GLM-4.7 的 $2,376.82,但低於 Claude Opus 4.5 的 $4,967.06 和 Gemini 3 Pro 的 $5,478.16。

智譜官方表示,GLM-5 已可通過 Z.ai API 平台 使用,並支援本地部署,相容 vLLM、SGLang、KTransformers 等主流開源框架。模型權重已在 Hugging Face 上開源,許可證為 MIT。

從產業視角看,GLM-5 的釋出體現了開源模型在規模與能力上的持續追趕,其整合 DeepSeek 稀疏注意力技術也反映了行業在降低推理成本方面的探索。對於 AI 基礎設施與模型層而言,這一進展可能加速智慧體應用的落地,並推動相關算力需求的增長。不過,模型的實際表現仍需在真實場景中進一步驗證。