智譜於近日釋出輕量級旗艦模型 GLM-5.3 Flash,明確對標 DeepSeek V4 Flash,並呼叫超過 10 萬張國產晶片叢集為其推理服務提供算力。據《晚點 LatePost》瞭解,其算力供應商或來自 華為摩爾線程海光,智譜官方未對此置評。

GLM-5.3 Flash 擁有 300B 引數規模,引數量約為 GLM-5.3 的 40%,與 DeepSeek V4 Flash 幾乎持平。與同代小尺寸模型常蒸餾自大模型不同,GLM-5.3 Flash 採用與 GLM-5.3 不同的架構設計,具備原生多模態能力,支援影像和影片輸入。這也是智譜戰略聚焦 coding 以來首次推出具有多模態能力的新模型。

根據《晚點 LatePost》看到的智譜內部評測,GLM-5.3 Flash 的 Artificial Analysis Intelligence 分數為 57 分,超過上一代旗艦模型 GLM-5.2,與 Claude Opus 4.8 持平,也高於 DeepSeek 旗艦模型 V4 Pro 正式版的 53 分。

定價方面,GLM-5.3 Flash 每百萬 token 輸入 0.8 元、輸出 2.8 元,快取命中價格 0.23 元,正好為 GLM-5.3 的十分之一。橫向對比調價後的 DeepSeek V4 Flash,其谷時價格分別為 1.5 元、4.5 元和 0.05 元。綜合輸入和輸出成本,GLM-5.3 Flash 在絕大多數常規呼叫場景下更便宜。智譜已表示,上線前兩週將實行半價。

正式釋出前,智譜已在包括 OpenRouter 在內的第三方開放平台以 Ox Alpha 名義測試,5 天流量累積據悉超過 50 T,由於完全免費,重新整理了 OpenRouter 與 OpenCode 的流量增長紀錄。這並非智譜首次匿名釋出新模型,今年春節前夕,OpenRouter 上曾出現名為 Pony Alpha 的模型,後被證實為智譜的 GLM-5。

GLM-5.3 Flash 全棧適配國產算力,線上流量均由國產晶片承接。智譜在技術文件中表示,其叢集“硬體效率及單位 token 成本已經達到了與主流輝達 GPU 相當的水平”,但未明確具體型號。

自 6 月以來,中國公司爭相釋出能力接近美國次等級閉源模型的產品。6 月 13 日智譜釋出 GLM-5.2,7 月中 Kimi 的 K3 模型釋出,8 月 DeepSeek V4 Pro 正式版釋出,智譜則在 8 月 14 日釋出 GLM-5.3,其引數與結構同 GLM-5.2 一致,但效能大幅提升,官方稱完全基於後訓練強化學習。

效能提升的同時,漲價一度成為敘事主流。Kimi K3 的輸出價格高達 100 元,超過 K2.6 三倍多;智譜上半年提價後輸出價格也達到 28 元。在流出的 梁文鋒 錄音中,他曾表示智慧需求沒有彈性,DeepSeek 只需賺取合理利潤,然而 8 月 DeepSeek 全面提價,V4 Pro 從 6 元漲到 13.5 元,高峰 27 元;V4 Flash 輸出從每百萬 token 2 元漲到 4.5 元,高峰 9 元,官方理由是算力稀缺、長期低價侵蝕現金流。

事實證明智慧能力需求同樣有彈性,尤其是輕量級旗艦模型。漲價後,在第三方平台 OpenCode 上,DeepSeek V4 Flash 呼叫量掉了一半,這部分需求成為國產模型廠商新的增長空間。在美國,被歸為第二梯隊的 MetaSpaceXAI 等正瞄準 OpenAI 和 Anthropic 的最先進模型,而後者的價格往往是中國模型的數十倍。以 Claude Opus 4.8 為例,官方輸出價格為 25 美元,而 GLM-5.3 Flash 海外輸出價格僅 0.5 美元

在中國,模型選擇多、能力差距小,廠商不僅要與同行競爭,還要面對開源部署、雲廠商贈送額度等,模型難以作為稀缺品定價,更接近標準雲服務價格。因此,中國廠商不斷將接近旗艦的模型能力推入低價區間,用價格、開源和相容性爭奪呼叫量。不考慮算力採購與研發成本,模型推理是毛利很高的生意,前提是有足夠大的需求與足夠用的效能。隨著 DeepSeek 提價,輕量旗艦模型覆蓋的市場區間或將迎來更多競爭者。