智譜AI(Z.ai)於Hugging Face釋出GLM-5系列首個原生多模態模型GLM-5.3-Flash。該模型總引數達320B,但啟用引數僅18B,在多項基準測試和真實工作負載中超越前代GLM-5.2,同時推理成本降至前代的十分之一,在編碼與智慧體相關基準上接近Claude Opus 4.8的水平。
GLM-5.3-Flash基於全新訓練的基座模型,其架構與訓練方案圍繞能力與效率重新設計。GLM系列首次引入稀疏與線性注意力混合架構,大幅降低長上下文服務成本,同時保持精確的長上下文能力。模型還採用Manifold-Constrained Hyper-Connections(mHC)技術以提升擴充套件效率。結合最新的30T token多模態預訓練語料,GLM-5.3-Flash實現了用更少算力獲得更強智慧。
該模型支援通過SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth等框架進行本地部署,並可通過Z.ai API平台呼叫服務。GLM-5.3-Flash支援通過`reasoning_effort`引數控制思考預算,提供`low`、`high`、`max`三檔,預設`max`;聊天場景建議顯式設定`clear_thinking=true`。
在評測方面,GLM-5.3-Flash在多個基準上採用嚴格設定,例如HLE with tools使用最大生成長度163,840 tokens、最大上下文300,000 tokens,並以GPT-5.6-luna作為裁判模型;NL2Repo在1M上下文下評估;DeepSWE使用mini-swe-agent harness,超時6小時,上下文400K;Terminal-Bench 2.1在Claude Code 2.1.207中評估。Agent’s Last Exam和Toolathlon Verified結果均通過官方評測服務獲得,報告pass@1在3次獨立執行中取平均。此外,GDPval-AA v2由Artificial Analysis評估,BabyVision使用溫度1.0、top_p 0.95,最大上下文164K tokens。
智譜AI在模型層持續發力,GLM-5.3-Flash的釋出標誌著其在多模態與效率最佳化上的新進展。混合注意力架構和mHC技術的引入,可能為長上下文應用帶來更經濟的推理方案,對依賴大規模AI服務的開發者和企業而言,成本下降意味著更低的准入門檻。同時,接近Claude Opus 4.8的編碼與智慧體表現,表明國產模型在複雜任務上正逐步縮小與海外領先模型的差距。
從產業角度看,GLM-5.3-Flash的低啟用引數設計(18B)體現了對推理效率的重視,這可能影響模型層競爭格局——在算力成本高企的背景下,高效模型更易獲得開發者青睞。此外,模型支援本地部署與API兩種方式,兼顧了資料隱私與易用性需求。隨著GLM系列持續迭代,智譜AI在AI產業鏈模型層的地位有望進一步鞏固,其技術路線或為行業提供參考。