8月14日,智譜釋出新一代旗艦模型GLM-5.3,API於8月19日正式開放呼叫,定價與GLM-5.2持平。模型沿用GLM-5.2基座,主要通過擴大後訓練規模提升Coding、長程Agent和網路安全能力。目前,模型已向全部GLM Coding Plan使用者開放,並上線ZCode、Claude Code、OpenCode等主流程式設計工具,模型權重將於下週五開源。

從測試結果看,GLM-5.3進步明顯。在Artificial Analysis最新綜合智慧指數中,GLM-5.3拿到60分,進入全球前沿模型區間,與Claude Fable 5、GPT-5.6 Sol等閉源旗艦同檔,並與Kimi K3並列開源模型第一。同時,按該機構統計的單任務成本,GLM-5.3在同檔模型中屬於低成本選手。

然而,模型能力提升並未延續前代的市場熱度。4月GLM-5.1釋出時,智譜收盤上漲11.5%;6月GLM-5.2釋出,股價上漲32.8%;但GLM-5.3釋出當天,智譜股價下跌3.6%。行業討論度也遠不及前幾次旗艦亮相。這種反差並非說明GLM-5.3沒有變強,而是反映在國產模型密集迭代、能力差距快速收窄的當下,跑分領先已難以讓市場興奮。對智譜而言,更關鍵的問題是:更強的模型能帶來多大差異化優勢?這種優勢能否轉化為產品和收入?

GLM-5.3的提升主要來自擴大後訓練規模。大模型研究員曾小健解釋,預訓練增加模型“讀過的東西”,後訓練則增加“做過的事情”——模型進入真實環境做任務、拿反饋、調整做法。支撐這輪後訓練的是一套訓練方式:IndexShare降低長上下文計算成本,SAO讓單任務完成後即可進入訓練,slime框架將任務執行與模型更新拆開,減少算力閒置。例如,在100個Agent任務中,若80個十分鐘完成、15個半小時、5個兩小時,傳統方式需等全部結束,新框架則無需等待,提高算力利用率。此外,GLM-5.3搭建了自動生成訓練環境的流程:Research Agent從真實工作找任務,Judge Agent試做確認,並檢查模型是否利用評分漏洞。

具體能力提升方面,程式設計能力進步顯著。在強調長程軟體工程的DeepSWE v1.1基準中,GLM-5.3從前代的46.2分提高到66.9分,能理解陌生專案、定位問題、呼叫工具、修改程式碼並據測試結果修正。智譜自己的Code Bench測試中,最高難度下GLM-5.3用平均約7.5萬輸出Token取得34.5%成績,而GLM-5.2需約9.6萬Token,成績僅23.4%。曾小健認為,完成率提高而Token消耗下降,說明模型學會了更有效探索,而非靠堆思考時間。獨立開發者李然(化名)體驗後認為,GLM-5.3相比5.2進步明顯,ZCode的Goal Mode能持續推進任務直到完成,長任務可靠性更高。

網路安全能力提升尤為突出。在ExploitBench漏洞利用推理測試中,GLM-5.3從前代的24.4%提高到54.4%,提升超一倍。智譜官方稱,從GLM-5.2開始,智譜聯合國內多家安全機構用模型尋找真實漏洞,到GLM-5.3釋出時,經專家複核、篩選、去重,累計發現2436個漏洞,覆蓋269個專案,其中1097個屬中高危,部分漏洞已存在數十年。

但放到同期對手中,GLM-5.3的優勢並非絕對。文章選取阿里、月之暗面、深度求索的最新旗艦作參照:DeepSeek V4 Pro有綜合能力和價格優勢;Kimi K3在長程軟體工程上與GLM-5.3貼身競爭,且擁有原生多模態;Qwen3.8-Max雖部分跑分不佔優,但背靠阿里生態,在企業工作流落地更有基礎。因此,GLM-5.3確實更強,但尚未形成讓同期國產旗艦短期難以追趕的優勢。

為何能力提升未帶來同等傳播?直接原因是升級方向相對“專業”——程式設計主要服務開發者,網路安全受眾是安全研究人員和企業客戶,能力實用但受眾集中。這與使用者期待存在錯位:此前智譜創始人唐傑在X上徵集期待,視覺、多模態呼聲較高。李然提到,不少開發任務難以用語言描述,尤其頁面設計和創意編碼,有了視覺能力模型能直接“看結果”。他實際使用中,GLM-5.3做常規程式碼任務好用,水平高過Kimi K3、略遜於GPT-5.6 Sol,但遊戲生成、創意編碼等依賴視覺反饋的場景體驗一般,甚至出現過按鈕歪斜的情況。

更大的變化是,新模型的新鮮感被密集釋出節奏消耗。僅智譜一家,GLM-5.1在4月、GLM-5.2在6月、GLM-5.3在8月14日,基本兩個月一次旗艦迭代。同行也頻繁更新:7月中旬Kimi K3上線,8月初Qwen3.8-Max跟進,8月中旬DeepSeek V4 Pro正式版釋出。不到一個月連續四款國產旗艦,一個模型剛憑跑分衝到前面,幾周就被新版本蓋過。“第一”的含金量降低,領先視窗期按周計算。能力趨同背後是各家解同一道題:Coding需訓練環境和高質量程式碼資料,Agent需長任務軌跡和工具呼叫訓練,多模態需補足圖片影片理解。一家驗證有效路徑後,同行很快投入資源,結果大家都在卷Coding、強調Agent、拉長上下文、補多模態。GLM-5.3提升的方向恰是競爭最擁擠的方向。“爆款”門檻變高,光靠能力提升不夠,還需“人無我有”的話題點。以同期釋出的DeepSeek V4 Pro為例,深度求索同步開源首款Harness產品,主打“一切皆外掛”,通過模型、工具、Agent執行元件重新組合製造新話題。因此,GLM-5.3未形成此前熱度幾乎是必然:能力提升未超預期,方向繞開使用者最想要的多模態,釋出時間還撞上DeepSeek。

回到公司層面,真正影響長期價值的是過去靠程式設計跑出的增長能否延續。2025年9月,智譜推出GLM Coding Plan,進入GLM-5系列後持續強化程式設計和長程任務,並推出程式設計工具ZCode。開發者願為效率付費,程式設計成為智譜API增長最快場景,初步驗證了模型能力、使用者呼叫和商業收入間的聯絡。但先發紅利正在減弱:其他國產廠商都把程式設計當作旗艦升級方向,開發者選擇增多。同時,智譜告別低價獲客:GLM Coding Plan剛推出時入門價20元/月,7月底全面開放後Lite版漲至118元/月,並改為積分制,設定每5小時和每週額度上限。漲價有現實難處:Coding Agent比普通聊天“吃Token”,長任務可能消耗數萬甚至數十萬Token,需求上漲而推理算力供給有限,低價難維持。但對開發者,價差足夠大時便宜會成為換模型理由,且切換成本不高,可同時使用多款模型。

程式設計場景已證明智譜能把模型能力變成收入,但考驗是能否留住靠模型優勢吸引的使用者。智譜的解法是往產品走:單純賣API,開發者可隨時切換;進入Agent後,專案上下文、工具配置、工作流程逐漸沉澱,遷移成本提高。ZCode和AutoClaw讓智譜從模型供應商進入真實工作流,建立更長期使用者關係。產品層上,智譜面對兩撥對手:一邊是阿里、位元組等大廠,手握使用者、賬號、資料和業務生態,可將AI接入辦公、雲服務和消費場景;另一邊是月之暗面、深度求索等模型公司,不斷向上做產品。智譜既要和大廠拼入口,又要和同類公司搶開發者。

產品對智譜還有一層價值:使用者反饋。曾小健提到,GPU可買、開源框架可複製、演算法論文會擴散,但真實工作環境、任務分佈、可靠驗證機制和使用者反饋會成為更難複製的資產。產品積累訂閱使用者的同時,真實反饋能幫助打造下一輪後訓練的“真題”。模型能力帶來使用者,產品沉澱真實任務,真實任務再幫助模型提升,這套迴圈轉起來,智譜才能把階段性優勢沉澱更久。但只有程式設計一個場景不夠。GLM-5.3新強化的網路安全有明顯優勢,有機會開啟企業需求,但尚未驗證能帶來大規模、持續增長的Token呼叫。

智譜的MaaS業務已證明市場願為模型能力付錢:2025年雲端MaaS服務收入佔總營收26.3%;截至2026年3月,MaaS平台ARR約17億元,過去一年增長約60倍。本地化部署收入仍佔73.7%,說明“中國版Anthropic”的故事已有商業基礎,但距離主要依靠標準化API和產品持續放大收入還有距離。7月,唐傑提出“摸高計劃”,未來兩年押注長程任務、自治智慧體系統、完全自我訓練和安全治理。智譜仍需把模型能力往上推,但商業上需找到第二個、第三個像程式設計一樣的高頻付費場景,把技術領先儘快轉化為產品使用和收入增長。GLM-5.3證明智譜還能把模型做強,更難的考題是如何把能力持續轉化為產品和生意。