智譜AI於今日釋出GLM-5系列的首個原生多模態模型GLM-5.3-Flash。該模型總引數達320B,但啟用引數僅18B,在多項基準測試和真實工作負載中表現優於前代GLM-5.2,而推理價格僅為後者的十分之一,在編碼和智慧體相關基準上接近Claude Opus 4.8的水平。
GLM-5.3-Flash基於全新訓練的基座模型,其架構和訓練方案圍繞能力與效率重新設計。模型首次在GLM系列中引入稀疏與線性注意力混合架構,在保留精確長上下文能力的同時,大幅降低長上下文推理的服務成本。此外,模型採用流形約束超連線(mHC) 技術以提升擴充套件效率,並配合最新的30T token多模態預訓練語料,實現用更少算力獲得更強智慧。
在部署方面,GLM-5.3-Flash支援SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth等主流推理框架,開發者可便捷地在本地執行。模型還支援通過reasoning_effort引數控制思考預算,提供低、高、最大三檔,預設設為最大,以適應不同場景的推理需求。
此次釋出延續了智譜在開源模型領域的激進策略。此前,GLM系列已在中文社群積累大量使用者,此次Flash版本以低價高能定位,可能進一步壓縮中小型模型廠商的生存空間,並推動多模態應用和智慧體開發的普及。從產業角度看,GLM-5.3-Flash的低推理成本有望降低AI應用開發門檻,利好下游應用層創新,同時可能加劇頭部模型廠商之間的價格戰,對算力服務商和雲廠商的定價策略產生影響。
值得注意的是,GLM-5.3-Flash在編碼和智慧體基準上的表現接近Claude Opus 4.8,這表明國產模型在複雜任務處理能力上正快速追趕國際領先水平。不過,實際效果仍需在真實業務場景中進一步驗證。智譜表示,更多技術細節將隨GLM-5技術報告釋出,開發者可通過Z.ai API平台呼叫該模型的雲端服務。