智譜AI(Z.ai)今日宣佈推出新一代模型GLM-5.3,目前僅在其編碼計劃中提供,API版本即將上線,並計劃於兩週後在Hugging Face上開放權重。據Interconnects報道,該模型在多項基準測試中表現突出,已超越月之暗面(Moonshot AI)的Kimi K3,部分指標甚至超過Anthropic的Claude Fable 5或OpenAI的GPT-5.6-Sol。值得注意的是,GLM-5.3的引數量僅約750億,相當於Kimi K3的三分之一,卻在智慧體編碼基準上接近前沿水平。
智譜在其官方部落格中直言:“GLM-5.3的全部工作就是擴充套件後訓練。”該模型與GLM-5.2共享同一基座模型,但後訓練階段大幅增強。這一策略與月之暗面形成鮮明對比——後者更側重於預訓練。評論認為,智譜在後訓練領域的技術積累是其優勢所在,而Kimi則被視為預訓練的傑作。
GLM系列的歷史可追溯至2019年智譜AI成立,其技術源自清華大學THUDM實驗室。從2021年3月的GLM,到2022年8月的GLM-130B,再到2023年3月的ChatGLM,以及2024年1月的GLM-4,智譜持續迭代。今年2月釋出的GLM-5是新一代大版本,而6月22日釋出的GLM-5.2曾引起廣泛關注,因其速度和簡潔性(無回滾等特性)受到AI研究者的青睞,部分人甚至將其部署在內部叢集以獲取更快速度。
面對中國實驗室的快速進步,美國業界常以“蒸餾”解釋,但Interconnects作者認為這不是主因。他指出,近期有論文展示了從前沿模型中提取推理軌跡的簡單方法,中國實驗室可能大規模使用,但美國實驗室卻未迅速修補,反而尋求政府政策支援。智譜的部落格強調使用了“更多環境、更多樣化的任務、更多計算資源”進行訓練,這並非簡單的蒸餾所能實現,因為強化學習環境、基礎設施和演算法難以複製。
那麼,中國實驗室如何保持前沿?作者認為關鍵在於釋出週期。智譜的釋出時間可能僅需數天,而OpenAI和Anthropic通常需要數月。儘管美國實驗室可能擁有更強大的內部模型,但漫長的釋出週期讓中國實驗室在基準測試上持續爬坡,從而在採用決策上佔據優勢。這種快速迭代策略在經濟上對美國實驗室尚可接受,因為他們仍有大量需求,但隨著模型自我改進迴圈的加速,如果反饋需要使用者資料,中國實驗室的快速釋出可能使其產品生命週期更長,進而削弱美國模型的需求。
作者還指出,智譜可能比OpenAI或Anthropic更關注公開基準,因為這些分數直接影響其股價和融資能力。作為挑戰者,在基準上超越美國巨頭是維持團隊士氣和吸引資本的重要故事。儘管存在“benchmaxxing”(針對測試集最佳化)的嫌疑,但作者認為這並非出於絕望,而是競爭策略的一部分。
總體而言,GLM-5.3的釋出再次證明,中國AI實驗室憑藉高效的後訓練和敏捷的迭代節奏,正在縮小與前沿的差距。這一趨勢對全球AI產業格局具有深遠影響,尤其是在模型能力競爭日益激烈的當下。