智谱AI(Z.ai)今日宣布推出新一代模型GLM-5.3,目前仅在其编码计划中提供,API版本即将上线,并计划于两周后在Hugging Face上开放权重。据Interconnects报道,该模型在多项基准测试中表现突出,已超越月之暗面(Moonshot AI)的Kimi K3,部分指标甚至超过Anthropic的Claude Fable 5或OpenAI的GPT-5.6-Sol。值得注意的是,GLM-5.3的参数量仅约750亿,相当于Kimi K3的三分之一,却在智能体编码基准上接近前沿水平。

智谱在其官方博客中直言:“GLM-5.3的全部工作就是扩展后训练。”该模型与GLM-5.2共享同一基座模型,但后训练阶段大幅增强。这一策略与月之暗面形成鲜明对比——后者更侧重于预训练。评论认为,智谱在后训练领域的技术积累是其优势所在,而Kimi则被视为预训练的杰作。

GLM系列的历史可追溯至2019年智谱AI成立,其技术源自清华大学THUDM实验室。从2021年3月的GLM,到2022年8月的GLM-130B,再到2023年3月的ChatGLM,以及2024年1月的GLM-4,智谱持续迭代。今年2月发布的GLM-5是新一代大版本,而6月22日发布的GLM-5.2曾引起广泛关注,因其速度和简洁性(无回滚等特性)受到AI研究者的青睐,部分人甚至将其部署在内部集群以获取更快速度。

面对中国实验室的快速进步,美国业界常以“蒸馏”解释,但Interconnects作者认为这不是主因。他指出,近期有论文展示了从前沿模型中提取推理轨迹的简单方法,中国实验室可能大规模使用,但美国实验室却未迅速修补,反而寻求政府政策支持。智谱的博客强调使用了“更多环境、更多样化的任务、更多计算资源”进行训练,这并非简单的蒸馏所能实现,因为强化学习环境、基础设施和算法难以复制。

那么,中国实验室如何保持前沿?作者认为关键在于发布周期。智谱的发布时间可能仅需数天,而OpenAI和Anthropic通常需要数月。尽管美国实验室可能拥有更强大的内部模型,但漫长的发布周期让中国实验室在基准测试上持续爬坡,从而在采用决策上占据优势。这种快速迭代策略在经济上对美国实验室尚可接受,因为他们仍有大量需求,但随着模型自我改进循环的加速,如果反馈需要用户数据,中国实验室的快速发布可能使其产品生命周期更长,进而削弱美国模型的需求。

作者还指出,智谱可能比OpenAI或Anthropic更关注公开基准,因为这些分数直接影响其股价和融资能力。作为挑战者,在基准上超越美国巨头是维持团队士气和吸引资本的重要故事。尽管存在“benchmaxxing”(针对测试集优化)的嫌疑,但作者认为这并非出于绝望,而是竞争策略的一部分。

总体而言,GLM-5.3的发布再次证明,中国AI实验室凭借高效的后训练和敏捷的迭代节奏,正在缩小与前沿的差距。这一趋势对全球AI产业格局具有深远影响,尤其是在模型能力竞争日益激烈的当下。