智譜AI(Z.ai)於今日在Hugging Face平台釋出了GLM-5.3-Flash,這是GLM-5系列中首個原生多模態模型。該模型總引數規模達320B,但啟用引數僅18B,官方宣稱其在基準測試和真實工作負載中效能超越前代GLM-5.2,而價格僅為後者的十分之一,在編碼和智慧體(agentic)基準上接近Claude Opus 4.8的水平。
GLM-5.3-Flash基於全新訓練的基座模型構建,其架構和訓練方案圍繞能力與效率重新設計。官方介紹,這是GLM系列首次引入稀疏注意力與線性注意力混合架構,顯著降低長上下文推理成本,同時保持精確的長上下文能力。模型還採用了Manifold-Constrained Hyper-Connections (mHC) 技術以提升擴充套件效率。配合最新的30T token多模態預訓練語料,這些改進使模型能夠以更少的算力提供更強的智慧。
在部署方面,GLM-5.3-Flash支援多種主流推理框架,包括SGLang、vLLM、TokenSpeed和KTransformers,方便開發者本地部署。模型採用MIT許可證,支援中英文,Hugging Face頁面顯示其引數規模為321B(含嵌入等),更新於31分鐘前。
從產業角度看,GLM-5.3-Flash的釋出延續了智譜在高效模型路線上的探索。以18B啟用引數實現接近頂尖閉源模型的效能,並大幅降低推理成本,這可能在模型層引發新的價格競爭,尤其對依賴API呼叫的應用開發者具有吸引力。同時,混合注意力架構的引入也反映了行業對降低長上下文推理成本的普遍關注,這對基礎設施層的算力排程和成本最佳化具有參考意義。
不過,官方公佈的基準成績(如HLE、NL2Repo、DeepSWE等)均基於特定評測設定,實際表現仍需獨立驗證。智譜在技術報告中詳細列出了評測方法,包括使用GPT-5.6-luna作為裁判模型等,顯示其試圖提高評測透明度。對於投資者而言,該模型的成本優勢可能影響智譜API的定價策略,進而影響其商業化程序,但具體市場反應尚待觀察。