GLM 是智谱(国际品牌 Z.ai)自研的大语言模型系列——别和统计学里的「广义线性模型(GLM)」搞混。截至 2026 年 9 月,GLM-5 这一代在售的主力有三档:GLM-5.3(当前旗舰,2026 年 8 月 19 日在国内开放平台上线)、GLM-5.3-Flash(8 月 26 日上线,GLM-5 系列首个原生多模态模型,API 价格是 GLM-5.3 的十分之一)和上一代旗舰 GLM-5.2(6 月 16 日上线,GLM 系列首个 1M 上下文版本)。三档都开放了权重;开发者在 bigmodel.cn 按量调 API,写代码的可以订 GLM Coding Plan 包月套餐。只想直接聊天的,入口是智谱清言,见 智谱清言官网入口。
GLM-5.3、GLM-5.3-Flash、GLM-5.2 参数对比
按智谱官方 GitHub(zai-org/GLM-5)的模型列表与各模型文档:GLM-5.3 规格 744B-A40B(总参数 7,440 亿、每个 token 激活 400 亿),和 GLM-5.2 用的是同一个基座模型,官方称所有提升都来自后训练;上下文 1M、最大输出 128K,只处理文本,思考模式强制开启、不能关闭,reasoning_effort 分 low/high/max 三档(默认 max)。GLM-5.3-Flash 规格 320B-A18B,是重新训练的新基座,采用稀疏注意力与线性注意力混合架构,官方称注意力计算量和 KV 缓存分别比 GLM-5.3 低 3.01 倍和 4.44 倍;支持图片、视频、文件、文本输入,同样是 1M 上下文、128K 输出。GLM-5.2 规格 744B-A40B,1M 上下文、128K 输出;再往前的 GLM-5.1(2026 年 4 月 7 日)与 GLM-5(2 月 12 日)上下文只有 200K。
GLM API 价格(bigmodel.cn 与 z.ai)
国内开放平台 bigmodel.cn 以人民币计价,单位是「元/百万 tokens」,这三档不按输入长度分段:GLM-5.3 输入 ¥8、输出 ¥28、缓存命中 ¥2;GLM-5.2 与之同价(¥8/¥28/¥2);GLM-5.3-Flash 输入 ¥0.8、输出 ¥2.8、缓存命中 ¥0.23,缓存存储费目前均为「限时免费」。官方模型文档另称 GLM-5.3-Flash 限时折扣期内价格为 GLM-5.3 的 1/20,但定价页没有标出折扣价和截止时间,以控制台实际扣费为准。国际版 z.ai 以美元计:GLM-5.3 与 GLM-5.2 输入 $1.4、缓存 $0.26、输出 $4.4;GLM-5.3-Flash 输入 $0.15、缓存 $0.03、输出 $0.50。对照老型号:GLM-5.1 输入 32K 以内为 ¥6/¥24,GLM-5 为 ¥4/¥18。
接入地址:OpenAI 协议走 https://open.bigmodel.cn/api/paas/v4,Anthropic 协议走 https://open.bigmodel.cn/api/anthropic。从 GLM-5.2 迁移要注意一点:GLM-5.3 不再支持 thinking.type: "disabled",旧代码不改会直接报错,官方建议改成 enabled 并把 reasoning_effort 设为 low。另外官方文档写明,订阅过 GLM Coding Plan(含已过期)的账号暂时只能用 OpenAI Chat Completion 协议调模型 API。全系价格横向对比见 智谱 GLM 全系模型价格。
GLM Coding Plan:档位、价格与额度
GLM Coding Plan 是面向 AI 编程的订阅套餐,2026 年 7 月 30 日改版为积分制,个人版分 Lite/Pro/Max 三档,另有团队版。价格:官方订阅页 bigmodel.cn/glm-coding 为 JS 渲染,本站没能从官方页直接抓到数字;据 IT之家 7 月 31 日报道新版「每月 118 元起」,第三方汇总的月付价为 Lite ¥118、Pro ¥538、Max ¥1,078,改版时的包季 8 折、包年 7 折据报道限时到 8 月 15 日,现价以订阅页为准。国际版文档 docs.z.ai 写明 18 美元/月起。额度(官方文档):Lite 每 5 小时 2,000 积分、每周 10,000 积分;Pro 为 12,000/60,000;Max 为 28,000/140,000。积分按 token 折算:GLM-5.3 每 1 万 tokens 输入扣 6.9、缓存命中扣 1.7、输出扣 24 积分,GLM-5.3-Flash 为 2.3/0.56/8;联网搜索、网页读取、开源仓库 MCP 每次扣 1.2 积分。高峰时段是工作日 14:00~18:00(北京时间),其余时段(含周末全天)按 50% 扣积分。官方给的参考量:缓存命中率 95% 时,每周可用的 GLM-5.3 约为 Lite 0.48~0.97 亿 tokens、Pro 2.90~5.80 亿、Max 6.76~13.52 亿,换成 GLM-5.3-Flash 约是三倍。
能在哪些工具里用:官方列出的 Coding Agent 工具有 ZCode(1.5 倍用量)、Claude Code、Claude for IDE、Codex、OpenCode、Pi Coding Agent、TRAE、CodeBuddy、Lingma、Qoder、Kilo、MonkeyCode、Cline、Droid、Roo、Crush、Goose、Cursor;通用 Agent 工具 AutoClaw(1.5 倍用量)、OpenClaw、Cherry Studio、Hermes Agent 也支持,但属于「次级调度」,高负载时会排队限流。所有档位都能用 GLM-5.3 与 GLM-5.3-Flash,工具里填旧名 GLM-5.2、GLM-5.1 会自动切到 GLM-5.3。几条规矩要先知道:只能在上述指定工具里用,自建应用、网站直接调 API 不走套餐额度;Claude Code 的 Base URL 填 https://open.bigmodel.cn/api/anthropic,其他工具填 https://open.bigmodel.cn/api/coding/paas/v4,填错会走按量计费、扣账户余额;套餐额度用完只需等下个周期,不会自动扣账户余额;一经购买不退款,取消自动续费要在扣费日至少 3 天前操作;禁止多人共用一个套餐。7 月 30 日前订阅的 V1/V2 老用户权益不变,可按原价续订。
官方公布的跑分(智谱自测)
GLM-5.3 模型卡列出的代表成绩(均为智谱自测,对比模型的数字也出自同一张表):Terminal Bench 2.1 88.2(GLM-5.2 为 81.0,Kimi K3 为 88.3,GPT-5.6 Sol 为 88.8)、Terminal Bench 3.0 28.3(GLM-5.2 仅 4.6,Fable 5 为 33.7)、DeepSWE 66.9(GLM-5.2 为 46.2)、CyberGym 84.5(表内最高)、HLE(带工具)62.5。官方文档也写明,在内部 Z.ai Code Bench 上 GLM-5.3 最高档准确率 34.5%,仍落后 Claude Fable 5 的 39.5%。GLM-5.3-Flash 方面,官方援引 Artificial Analysis 综合智能指数称其得 57 分,超过 GLM-5.2、与 Claude Opus 4.8 持平。GLM-5.2 模型卡的成绩包括 SWE-bench Pro 62.1、GPQA-Diamond 91.2、AIME 2026 99.2。第三方横向排名见 大模型能力排行榜。
开源许可证:GLM-5.3 不再是纯 MIT
三档权重都挂在 Hugging Face 的 zai-org 组织和魔搭的 ZhipuAI 组织下:GLM-5.3(FP8)与 GLM-5.3-BF16、GLM-5.3-Flash(FP8)与 GLM-5.3-Flash-BF16、GLM-5.2(BF16)与 GLM-5.2-FP8。GLM-5.2 和 GLM-5.3-Flash 是 MIT 许可;GLM-5.3 改用自定义的「GLM-5.3 License」,按许可证原文,依然允许免费使用、修改、分发和商用,新增的唯一条件是:运营「模型即服务」业务、且连同关联方连续 12 个月总收入超过 100 亿美元的企业,商用前须通过 Z.AI 的安全审查。对绝大多数公司和个人开发者没有实际影响。老教程里的 THUDM/ 仓库链接会自动跳到 zai-org。
本地部署 GLM-5.3 要什么硬件
官方模型卡列出的推理框架有 SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth,GLM-5.3 另写明昇腾 NPU 可用 vLLM-Ascend、xLLM 和 SGLang。按 Hugging Face 仓库文件体积:GLM-5.3 的 FP8 权重约 756 GB(BF16 版约翻倍),GLM-5.2 的 BF16 权重约 1,507 GB,GLM-5.3-Flash 的 FP8 权重约 328 GB。据此估算(本站按权重体积推算,非官方要求):GLM-5.3 FP8 放进单台 8 卡 H200(8 × 141 GB = 1,128 GB)还留有 KV 缓存空间,8 卡 H100(640 GB)装不下;GLM-5.3-Flash FP8 用 8 卡 H100 或 4 卡 H200(564 GB)级别就能装下权重。个人设备方面,Unsloth 文档给出 GLM-5.3 的 2-bit 动态量化(UD-IQ2_M)约 239 GB,建议在 256 GB 内存的机器(如 Mac Studio)上跑,精度和速度都要打折扣。普通消费级显卡跑不动这三档,显存对照见 本地部署显卡选型。
z.ai、bigmodel.cn、chatglm.cn 是什么关系
三个都是智谱官方的:bigmodel.cn(open.bigmodel.cn)是国内开放平台,人民币计价,中文文档在 docs.bigmodel.cn;z.ai 是国际站,美元计价,英文文档在 docs.z.ai,对话入口 chat.z.ai 可用 Google、GitHub 账号登录;chatglm.cn 是国内面向个人用户的对话产品「智谱清言」。同一个模型两边的价格不是按汇率简单换算,例如 GLM-5.3-Flash 输出国内 ¥2.8、国际 $0.50。据 IT之家报道,智谱公司英文名称已变更为 Z.AI Co., Ltd。几个域名的详细辨析见 智谱清言入口页,公司背景见 智谱公司词条。