智谱于近日发布轻量级旗舰模型 GLM-5.3 Flash,明确对标 DeepSeek V4 Flash,并调用超过 10 万张国产芯片集群为其推理服务提供算力。据《晚点 LatePost》了解,其算力供应商或来自 华为、摩尔线程与 海光,智谱官方未对此置评。
GLM-5.3 Flash 拥有 300B 参数规模,参数量约为 GLM-5.3 的 40%,与 DeepSeek V4 Flash 几乎持平。与同代小尺寸模型常蒸馏自大模型不同,GLM-5.3 Flash 采用与 GLM-5.3 不同的架构设计,具备原生多模态能力,支持图像和视频输入。这也是智谱战略聚焦 coding 以来首次推出具有多模态能力的新模型。
根据《晚点 LatePost》看到的智谱内部评测,GLM-5.3 Flash 的 Artificial Analysis Intelligence 分数为 57 分,超过上一代旗舰模型 GLM-5.2,与 Claude Opus 4.8 持平,也高于 DeepSeek 旗舰模型 V4 Pro 正式版的 53 分。
定价方面,GLM-5.3 Flash 每百万 token 输入 0.8 元、输出 2.8 元,缓存命中价格 0.23 元,正好为 GLM-5.3 的十分之一。横向对比调价后的 DeepSeek V4 Flash,其谷时价格分别为 1.5 元、4.5 元和 0.05 元。综合输入和输出成本,GLM-5.3 Flash 在绝大多数常规调用场景下更便宜。智谱已表示,上线前两周将实行半价。
正式发布前,智谱已在包括 OpenRouter 在内的第三方开放平台以 Ox Alpha 名义测试,5 天流量累积据悉超过 50 T,由于完全免费,刷新了 OpenRouter 与 OpenCode 的流量增长纪录。这并非智谱首次匿名发布新模型,今年春节前夕,OpenRouter 上曾出现名为 Pony Alpha 的模型,后被证实为智谱的 GLM-5。
GLM-5.3 Flash 全栈适配国产算力,线上流量均由国产芯片承接。智谱在技术文档中表示,其集群“硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平”,但未明确具体型号。
自 6 月以来,中国公司争相发布能力接近美国次等级闭源模型的产品。6 月 13 日智谱发布 GLM-5.2,7 月中 Kimi 的 K3 模型发布,8 月 DeepSeek V4 Pro 正式版发布,智谱则在 8 月 14 日发布 GLM-5.3,其参数与结构同 GLM-5.2 一致,但性能大幅提升,官方称完全基于后训练强化学习。
性能提升的同时,涨价一度成为叙事主流。Kimi K3 的输出价格高达 100 元,超过 K2.6 三倍多;智谱上半年提价后输出价格也达到 28 元。在流出的 梁文锋 录音中,他曾表示智能需求没有弹性,DeepSeek 只需赚取合理利润,然而 8 月 DeepSeek 全面提价,V4 Pro 从 6 元涨到 13.5 元,高峰 27 元;V4 Flash 输出从每百万 token 2 元涨到 4.5 元,高峰 9 元,官方理由是算力稀缺、长期低价侵蚀现金流。
事实证明智能能力需求同样有弹性,尤其是轻量级旗舰模型。涨价后,在第三方平台 OpenCode 上,DeepSeek V4 Flash 调用量掉了一半,这部分需求成为国产模型厂商新的增长空间。在美国,被归为第二梯队的 Meta 和 SpaceXAI 等正瞄准 OpenAI 和 Anthropic 的最先进模型,而后者的价格往往是中国模型的数十倍。以 Claude Opus 4.8 为例,官方输出价格为 25 美元,而 GLM-5.3 Flash 海外输出价格仅 0.5 美元。
在中国,模型选择多、能力差距小,厂商不仅要与同行竞争,还要面对开源部署、云厂商赠送额度等,模型难以作为稀缺品定价,更接近标准云服务价格。因此,中国厂商不断将接近旗舰的模型能力推入低价区间,用价格、开源和兼容性争夺调用量。不考虑算力采购与研发成本,模型推理是毛利很高的生意,前提是有足够大的需求与足够用的性能。随着 DeepSeek 提价,轻量旗舰模型覆盖的市场区间或将迎来更多竞争者。