8月26日晚,智譜正式上線並開源GLM-5.3-Flash(320B-A18B),這是GLM-5系列的首個原生多模態模型。該模型總引數達320B,能力超過GLM-5.2,在全球權威的Artificial Analysis Intelligence Index(AA綜合智慧指數)中取得57分,進入全球前沿模型能力區間,與Anthropic最受歡迎的模型Claude Opus 4.8得分持平。

GLM-5.3-Flash的架構專為極低成本設計,結合智譜最新的30T Token多模態預訓練語料,能以更少的計算資源實現更強效能。商湯大裝置依託先進的國產異構混推技術,為GLM-5.3-Flash上線提供大規模國產算力支援與Token服務,打造國產算力規模化商用的又一落地標杆。

這一合作背後是商湯打造的“一套模型、一座Token工廠、一套智慧體管控系統”核心能力體系。Token工廠承擔著把智慧能力規模化生產的關鍵作用:通過多模態模型和大裝置基礎設施的聯合最佳化,把不同晶片、叢集、能源和交付節點組織起來,持續生產更高質量、成本更低的Token。同時,Token工廠與大模型之間構建起雙向反哺閉環,更好適配原生多模態模型的迭代需求。

長期以來,市場對國產算力的認知是價效比不高、難以規模商用。而在正式釋出前,GLM-5.3-Flash以匿名模型Ox-Alpha(中文社群稱作牛來)在OpenCode和OpenRouter上進行了大規模測試,Token呼叫量高達62T,這些請求流量全部由國產晶片提供算力支援。且相較同一硬體環境下的初始基線,GLM-5.3-Flash基於國產晶片叢集,端到端服務效能提升3倍,硬體效率和單Token成本已達到主流輝達GPU相當水平。這一實踐表明,國產算力已經能夠在大規模真實業務場景下,高效、經濟地支撐前沿大模型推理需求。

作為“最懂大模型的AI基礎設施”,商湯大裝置全面擁抱國產化,並持續推動國產算力從“單點可用”走向“大規模商用”。今年WAIC期間,針對國產算力規模化商用卡點,商湯大裝置從“價效比、適配性、能效比”三個維度系統性破題。在價效比層面,商湯大裝置跳出單卡效能比拼的傳統思路,通過異構混合推理技術,根據不同推理階段對計算、頻寬的不同需求,讓不同架構、不同定位的國產晶片各盡其長、高效協同,整體推理價效比達到NVIDIA H系列的1.25倍,相比國產同構推理,同等成本下Token產能擴大約2.5倍。在適配性上,通過底層運算元最佳化、多卡並行調優和工具鏈適配等,大幅降低國產算力應用門檻。在能效比層面,商湯大裝置推出算電協同Agent,並重新定義TPW(Tokens Per Watt)作為AIDC全新價值標尺。

此外,通過整合多元算力,並持續最佳化推理引擎與晶片效能,商湯大裝置Token Factory正在形成大規模、高效率、低成本的Token供給能力,7月日均Token服務量已達到2.42萬億,預計2026年年底突破日均10萬億,全年Token量級增長25倍。未來,商湯大裝置將持續投入基於國產化算力的Token服務建設,打造高效能、低成本、可規模交付的AI基礎設施,推動國產算力從單點技術突破走向產業體系化繁榮。