8月14日,智谱发布新一代旗舰模型GLM-5.3,API于8月19日正式开放调用,定价与GLM-5.2持平。模型沿用GLM-5.2基座,主要通过扩大后训练规模提升Coding、长程Agent和网络安全能力。目前,模型已向全部GLM Coding Plan用户开放,并上线ZCode、Claude Code、OpenCode等主流编程工具,模型权重将于下周五开源。
从测试结果看,GLM-5.3进步明显。在Artificial Analysis最新综合智能指数中,GLM-5.3拿到60分,进入全球前沿模型区间,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同档,并与Kimi K3并列开源模型第一。同时,按该机构统计的单任务成本,GLM-5.3在同档模型中属于低成本选手。
然而,模型能力提升并未延续前代的市场热度。4月GLM-5.1发布时,智谱收盘上涨11.5%;6月GLM-5.2发布,股价上涨32.8%;但GLM-5.3发布当天,智谱股价下跌3.6%。行业讨论度也远不及前几次旗舰亮相。这种反差并非说明GLM-5.3没有变强,而是反映在国产模型密集迭代、能力差距快速收窄的当下,跑分领先已难以让市场兴奋。对智谱而言,更关键的问题是:更强的模型能带来多大差异化优势?这种优势能否转化为产品和收入?
GLM-5.3的提升主要来自扩大后训练规模。大模型研究员曾小健解释,预训练增加模型“读过的东西”,后训练则增加“做过的事情”——模型进入真实环境做任务、拿反馈、调整做法。支撑这轮后训练的是一套训练方式:IndexShare降低长上下文计算成本,SAO让单任务完成后即可进入训练,slime框架将任务执行与模型更新拆开,减少算力闲置。例如,在100个Agent任务中,若80个十分钟完成、15个半小时、5个两小时,传统方式需等全部结束,新框架则无需等待,提高算力利用率。此外,GLM-5.3搭建了自动生成训练环境的流程:Research Agent从真实工作找任务,Judge Agent试做确认,并检查模型是否利用评分漏洞。
具体能力提升方面,编程能力进步显著。在强调长程软件工程的DeepSWE v1.1基准中,GLM-5.3从前代的46.2分提高到66.9分,能理解陌生项目、定位问题、调用工具、修改代码并据测试结果修正。智谱自己的Code Bench测试中,最高难度下GLM-5.3用平均约7.5万输出Token取得34.5%成绩,而GLM-5.2需约9.6万Token,成绩仅23.4%。曾小健认为,完成率提高而Token消耗下降,说明模型学会了更有效探索,而非靠堆思考时间。独立开发者李然(化名)体验后认为,GLM-5.3相比5.2进步明显,ZCode的Goal Mode能持续推进任务直到完成,长任务可靠性更高。
网络安全能力提升尤为突出。在ExploitBench漏洞利用推理测试中,GLM-5.3从前代的24.4%提高到54.4%,提升超一倍。智谱官方称,从GLM-5.2开始,智谱联合国内多家安全机构用模型寻找真实漏洞,到GLM-5.3发布时,经专家复核、筛选、去重,累计发现2436个漏洞,覆盖269个项目,其中1097个属中高危,部分漏洞已存在数十年。
但放到同期对手中,GLM-5.3的优势并非绝对。文章选取阿里、月之暗面、深度求索的最新旗舰作参照:DeepSeek V4 Pro有综合能力和价格优势;Kimi K3在长程软件工程上与GLM-5.3贴身竞争,且拥有原生多模态;Qwen3.8-Max虽部分跑分不占优,但背靠阿里生态,在企业工作流落地更有基础。因此,GLM-5.3确实更强,但尚未形成让同期国产旗舰短期难以追赶的优势。
为何能力提升未带来同等传播?直接原因是升级方向相对“专业”——编程主要服务开发者,网络安全受众是安全研究人员和企业客户,能力实用但受众集中。这与用户期待存在错位:此前智谱创始人唐杰在X上征集期待,视觉、多模态呼声较高。李然提到,不少开发任务难以用语言描述,尤其页面设计和创意编码,有了视觉能力模型能直接“看结果”。他实际使用中,GLM-5.3做常规代码任务好用,水平高过Kimi K3、略逊于GPT-5.6 Sol,但游戏生成、创意编码等依赖视觉反馈的场景体验一般,甚至出现过按钮歪斜的情况。
更大的变化是,新模型的新鲜感被密集发布节奏消耗。仅智谱一家,GLM-5.1在4月、GLM-5.2在6月、GLM-5.3在8月14日,基本两个月一次旗舰迭代。同行也频繁更新:7月中旬Kimi K3上线,8月初Qwen3.8-Max跟进,8月中旬DeepSeek V4 Pro正式版发布。不到一个月连续四款国产旗舰,一个模型刚凭跑分冲到前面,几周就被新版本盖过。“第一”的含金量降低,领先窗口期按周计算。能力趋同背后是各家解同一道题:Coding需训练环境和高质量代码数据,Agent需长任务轨迹和工具调用训练,多模态需补足图片视频理解。一家验证有效路径后,同行很快投入资源,结果大家都在卷Coding、强调Agent、拉长上下文、补多模态。GLM-5.3提升的方向恰是竞争最拥挤的方向。“爆款”门槛变高,光靠能力提升不够,还需“人无我有”的话题点。以同期发布的DeepSeek V4 Pro为例,深度求索同步开源首款Harness产品,主打“一切皆插件”,通过模型、工具、Agent运行组件重新组合制造新话题。因此,GLM-5.3未形成此前热度几乎是必然:能力提升未超预期,方向绕开用户最想要的多模态,发布时间还撞上DeepSeek。
回到公司层面,真正影响长期价值的是过去靠编程跑出的增长能否延续。2025年9月,智谱推出GLM Coding Plan,进入GLM-5系列后持续强化编程和长程任务,并推出编程工具ZCode。开发者愿为效率付费,编程成为智谱API增长最快场景,初步验证了模型能力、用户调用和商业收入间的联系。但先发红利正在减弱:其他国产厂商都把编程当作旗舰升级方向,开发者选择增多。同时,智谱告别低价获客:GLM Coding Plan刚推出时入门价20元/月,7月底全面开放后Lite版涨至118元/月,并改为积分制,设置每5小时和每周额度上限。涨价有现实难处:Coding Agent比普通聊天“吃Token”,长任务可能消耗数万甚至数十万Token,需求上涨而推理算力供给有限,低价难维持。但对开发者,价差足够大时便宜会成为换模型理由,且切换成本不高,可同时使用多款模型。
编程场景已证明智谱能把模型能力变成收入,但考验是能否留住靠模型优势吸引的用户。智谱的解法是往产品走:单纯卖API,开发者可随时切换;进入Agent后,项目上下文、工具配置、工作流程逐渐沉淀,迁移成本提高。ZCode和AutoClaw让智谱从模型供应商进入真实工作流,建立更长期用户关系。产品层上,智谱面对两拨对手:一边是阿里、字节等大厂,手握用户、账号、数据和业务生态,可将AI接入办公、云服务和消费场景;另一边是月之暗面、深度求索等模型公司,不断向上做产品。智谱既要和大厂拼入口,又要和同类公司抢开发者。
产品对智谱还有一层价值:用户反馈。曾小健提到,GPU可买、开源框架可复制、算法论文会扩散,但真实工作环境、任务分布、可靠验证机制和用户反馈会成为更难复制的资产。产品积累订阅用户的同时,真实反馈能帮助打造下一轮后训练的“真题”。模型能力带来用户,产品沉淀真实任务,真实任务再帮助模型提升,这套循环转起来,智谱才能把阶段性优势沉淀更久。但只有编程一个场景不够。GLM-5.3新强化的网络安全有明显优势,有机会打开企业需求,但尚未验证能带来大规模、持续增长的Token调用。
智谱的MaaS业务已证明市场愿为模型能力付钱:2025年云端MaaS服务收入占总营收26.3%;截至2026年3月,MaaS平台ARR约17亿元,过去一年增长约60倍。本地化部署收入仍占73.7%,说明“中国版Anthropic”的故事已有商业基础,但距离主要依靠标准化API和产品持续放大收入还有距离。7月,唐杰提出“摸高计划”,未来两年押注长程任务、自治智能体系统、完全自我训练和安全治理。智谱仍需把模型能力往上推,但商业上需找到第二个、第三个像编程一样的高频付费场景,把技术领先尽快转化为产品使用和收入增长。GLM-5.3证明智谱还能把模型做强,更难的考题是如何把能力持续转化为产品和生意。