2026 年 8 月 26 日,两份模型卡先后出现在 Hugging Face 上。智谱把新模型叫 GLM-5.3-Flash,阿里通义千问把新模型叫 Qwen3.8-Flash-Next。[1][2] 两家都用了同一个词——Flash。
智谱在模型卡上给的口径很直接:多项基准超过上一代 GLM-5.2,价格是 GLM-5.2 的十分之一。[1]
不是打九折,不是季末促销,是把小数点往左挪一位。
结论先行
国产模型的低价不是补贴出来的。据 The Information 报道,DeepSeek 今年前七个月卖出一次 API 调用,扣掉直接成本后还能剩下 82.9%,厚过多数软件生意。[6][8] 价格能压到闭源模型的几十分之一,靠的是把一次调用里三段最贵的开销分别拆掉:叫醒的参数、注意力的账单、重复读过的前文。真正在流血的是另一格——同期约 110 亿元人民币的基建投入。[6]
「赔本赚吆喝」解释不了这张价目表
每百万 token 的标价如下(token 是模型处理文字的最小单位,一个汉字大致算一到两个),单位美元:
| 模型 | 输入 | 缓存命中输入 | 输出 |
|---|---|---|---|
| GLM-5.3-Flash(Z.ai 标价) | 0.15 | 0.03 | 0.50 |
| DeepSeek V4 Flash(低峰) | 0.22 | 0.007 | 0.66 |
| DeepSeek V4 Flash(高峰) | 0.44 | 0.014 | 1.32 |
| Claude Opus 4.8 | 5 | — | 25 |
| GPT-5.6 Sol(促销价) | 4 | — | 20 |
闭源两家各有自己的缓存折扣口径,此处只对比标价。[3][4][12][13]
几个除法的结果是硬的:GLM-5.3-Flash 的输出价 0.50 美元对 Opus 4.8 的 25 美元,是五十分之一;输入价 0.15 美元对 5 美元,是三十三分之一。[1][4][12] 换成 GPT-5.6 Sol 的促销价当分母,输出仍差四十倍。[13] GLM-5.3-Flash 发布期另挂着限时五折,但那是促销,需要解释的是打折之前的标价本身。[4]
面对这种价差,市场有一个现成的解释:中国公司在打价格战,用亏损换份额,等对手撑不住再说。这个解释省事,而且过去十年在电商、网约车、共享单车上都验证过。
它在这里对不上账。据 The Information 报道,DeepSeek 今年前七个月的营收约 4.75 亿元人民币(约 6707 万美元),约为 2025 全年的十倍,而其中 API 业务的毛利率是 82.9%。[6][7][8] 一门赔本赚吆喝的生意,不会在最核心的那格上留下这样的数字。
钱是省出来的,不是贴出来的。省在三处。
第一处:320B 的模型,每个字只叫醒 18B
第一处最容易被误读——大家判断模型先认总参数,而总参数几乎不决定单次调用的成本。
MoE(混合专家)的思路是把一个大模型拆成很多小专家,每处理一个 token 只叫醒其中几个,其余的躺在显存里不动。DeepSeek 早在 DeepSeek-MoE 上就做过一个 16B 参数、每 token 只激活 2.7B 的版本,并在标准 MoE 之外加了一个「共享专家」——它永远在岗,负责通用能力;其余的「路由专家」按需上工,负责专门活。这样既缓解了专家忙闲不均,也避免几个专家学同一件事。
这一代的激活比压得更狠:
- GLM-5.3-Flash:总参数 320B,每次激活 18B,约 5.6%。[1]
- Qwen3.8-Flash-Next:总参数 125B,每 token 激活 6B,约 4.8%。共 512 个专家,每次叫醒 10 个路由专家外加 1 个始终在岗的共享专家。[2]
- DeepSeek V4 Flash:以极低的参数激活比压低推理成本,被视为其性价比优势的核心。
省掉的是哪一笔?是每个 token 要走的矩阵乘法量。模型每吐一个字,要做的浮点运算大致跟着参与计算的参数走,而不是跟着摆在那里的参数走。320B 的模型和 18B 的模型,在这一笔账上是同一个量级。
落到价目表上,这是输出价能进到一美元以内的第一个前提。也是「模型很大」和「调用很便宜」这两件事能同时成立的原因。
这一处有个天花板:稀疏化省的是算力,不省显存——320B 的权重还是得整个装进机器。真正把长文本的成本咬住的,是下一笔。
第二处:把最贵的那种注意力限量供应
注意力是 Transformer 的核心动作:模型每生成一个字,都要回头看一遍前面已有的内容,判断哪些相关。标准做法是每个新字都跟全部旧字比一遍,开销随着长度按平方涨——上下文翻十倍,这笔账翻一百倍。
配套的还有 KV cache,即模型把读过的内容在显存里存成一份「备忘」,免得每次从头算。文本越长,这份备忘越占地方,而显存是推理成本里最贵的一块。
三家的解法不同,方向一致:让最贵的那种注意力少出场。
DeepSeek 走的是压缩路线。 V2 时代用多头潜在注意力(MLA)替代标准多头注意力,靠低秩近似把潜在向量压小,直接缩掉 KV cache 的体积。到 V4,改用 Token-wise Compression 配 DeepSeek Sparse Attention(DSA,一种选择性回看机制,让模型不必每个 token 都重读整段上下文),KV cache 可压缩 4 倍至 128 倍。[9][10] V4 另有约束稀疏注意力(CSA)与重度压缩注意力(HCA)两项改进。
Qwen 走的是配比路线,而且把比例写死在了架构里。Qwen3.8-Flash-Next 的 48 层中,每 4 层有 3 层走 Gated DeltaNet——线性注意力,开销随长度线性涨而非平方涨;只有 1 层走 Qwen Sparse Attention(QSA),在 micro-block 级别挑重点回看。算下来 36 层线性、12 层稀疏。[2] 更值得看的是头数:QSA 只有 2 个 KV 头,对着 24 个 Q 头——KV 头的数量直接决定那份「备忘」有多厚,而这里只留了两份。[2]
智谱走的是混用路线。 GLM-5.3-Flash 直接采用稀疏与线性注意力的混合架构,[1] 而 GLM-5 系列此前已集成过 DeepSeek 的 DSA 技术来压部署成本。三家还共用了一个不那么起眼的部件:mHC(Manifold-Constrained Hyper-Connections,一种强化残差连接、提升扩展效率的结构),DeepSeek V4 和 GLM-5.3-Flash 都在用。[1]
Qwen 还有一手更少见的账:51B 的 n-gram 嵌入参数,放在第 2 层,走 bigram 和 trigram(相邻两字、三字的固定组合)。[2] 这 51B 不计入那 6B 激活参数——因为嵌入表是查出来的,不是算出来的,它不参与每个 token 的矩阵乘法。相当于把「查得到的东西」从算力账挪进了存储账,而存储比算力便宜得多。
Qwen 这套配比集中在一张表里:
| 项目 | 数字 |
|---|---|
| 总参数 | 125B |
| 每 token 激活 | 6B(约 4.8%) |
| n-gram 嵌入参数 | 51B(置于第 2 层,bigram / trigram) |
| 多 token 预测(MTP,一次预测多个字的辅助模块) | 4B |
| 专家配置 | 512 个专家,每次激活 10 个路由专家 + 1 个共享专家 |
| 注意力配比 | 每 4 层:3 层 Gated DeltaNet(线性)+ 1 层 QSA(稀疏),全模型 36 : 12 |
| QSA 头数 | 24 个 Q 头 / 2 个 KV 头 |
| 原生上下文 | 262,144 token,可用 YaRN 扩展至 1,000,000 |
[2]
落到价目表上,这一处买来的是长上下文不再是加价项。GLM-5.3-Flash 的评测里最长用到 300,000 token,训练语料是 30T token 的多模态数据,也是 GLM-5 系列首个原生多模态模型。[1] 从前长文档要按天价计,现在跟短对话共用同一栏标价。
第三处:读过的前文,第二遍几乎不再收钱
前两处压的是算力和显存。第三处干脆把一部分工作整个取消。
一个 Agent 跑三十轮,每一轮都要把之前的对话、工具说明、文档原文重新发给模型;一份合同问十个问题,十次请求里有九成内容一模一样。传统做法是每次从头预填充一遍——同一段文字被反复读,反复收钱。
缓存命中就是服务器认出「这段前缀我算过」,直接调出中间结果接着往下走。价目表上的差距因此惊人:
- DeepSeek V4 Flash 低峰时段,缓存命中输入每百万 token 收 0.007 美元,未命中收 0.22 美元,相差约 31 倍。[3]
- GLM-5.3-Flash 是 0.03 美元对 0.15 美元,5 倍。[1][4]
命中率是这一处值多少钱的全部关键。据实验数据,DeepSeek V4 即使间隔 12 小时,缓存仍保持 100% 命中,这被视为其低价护城河的构成部分。12 小时意味着什么?昨晚放下的对话,今早接着问,前文那一段依然按 0.007 美元结算。
DeepSeek 还在 2026 年 8 月 16 日 16:00 UTC 起把统一价改成了分时计价:高峰是低峰的两倍,高峰时段为 UTC 01:00–04:00 与 06:00–10:00。[3] 价格开始跟着机器的忙闲走,这本身就是一句关于成本结构的自白——定价盯的不只是每次调用花了多少,还有那批机器有没有闲着。
三处的总账:
| 省在哪 | 机制 | 省掉的开销 | 价目表上的落点 |
|---|---|---|---|
| 参数稀疏化 | MoE,只叫醒一小撮专家 | 每 token 的矩阵乘法量按激活参数走 | 320B / 125B 级模型的输出价能进到一美元以内 |
| 注意力 | 稀疏 + 线性混合、KV cache 压缩 | 长上下文的平方级算力与显存占用 | 二十六万到三十万 token 的上下文不再单独加价 |
| 缓存命中 | 重复前缀直接复用中间结果 | 整段前文的重复预填充 | 命中 0.007 美元对未命中 0.22 美元 |
对账:赚钱的是调用,亏钱的是产能
三处机制省下的钱,最终要落到一本真账上才算数。DeepSeek 那本账少见地被拆到了 API 这一格,数字出自 The Information 引述的匿名信源,公司未予确认。[6][7]
据该报道,2026 年前七个月:营收约 4.75 亿元人民币,约十倍于 2025 全年;API 业务毛利率 82.9%,公司整体毛利率 44.6%;净亏损约 7.15 亿元人民币,而 2025 全年净亏 9.35 亿元;同期投入 AI 基础设施约 110 亿元人民币,主要用于租用 AI 芯片服务器与采购算力设备,2025 全年这一项只有 12 亿元。[6][7][8]
毛利率是卖出一块钱的服务、扣掉直接成本后剩下多少。API 那一格 82.9%,说明这三处确实把单次调用的成本压到了标价的两成以内——这一格不但不亏,还厚过许多软件生意。
整体 44.6% 是另一回事。4.75 亿元乘 44.6%,整体毛利约 2.1 亿元,离 7.15 亿元的亏损差着一整层费用。而同期 110 亿元的基建投入,是营收的二十三倍多,是去年同一项的九倍多。
亏的不是调用,是产能。 那批机器,绝大部分还没开始产生营收——有的刚上电,有的还在路上,有的对应的是 DeepSeek 正在内蒙古乌兰察布筹建的 1GW 级数据中心,据彭博社报道其部分算力预计在 2027 年底或 2028 年初才投运。训练、研发、折旧摆在账的另一侧,靠 4.75 亿元量级的营收去追。
这也正是降价还能继续的原因。单次调用那一格留着的空间还厚,成本曲线还在往下走,产能上来之后固定成本被摊得更薄——每一项都指向同一个方向。一个单点更直白:DeepSeek-V4-Flash-0731 在 ARC-AGI-2 基准下的单任务成本仅 0.042 美元,与 GPT-5.6-Luna-0730 成绩相近但成本低 4 倍多,被认为留有较大调价空间。
同一份报道还写到,DeepSeek 正在推进第二轮融资,目标募资 500 亿元人民币、估值 5000 亿元人民币,并在筹备上海 IPO。[6][7] 一门单次调用毛利这么厚的生意,去募一笔相当于其前七个月营收一百倍的钱——两个数字放在一起,就是这门生意当下的全部张力:赚钱的部分很赚,要养的部分很大。
账单上的第四行
这三处有一个共同点:全都写在公开的模型卡和技术报告里。MoE 的激活比、注意力的层间配比、KV cache 压多少倍、缓存命中窗口有多长——权重开源,论文可读,代码可跑。GLM-5 集成 DeepSeek 的 DSA,Qwen3.8-Flash-Next 把 DeepSeek-V4-Flash 直接列进对比基准。[2]
一条谁都能走的路,撑不起护城河,只能算新的地板。
而账单上还有第四行,三家刚开始各走各的——芯片本身。阿里云自研的真武 M890 已经上线并开始规模化销售,其超节点实例支持超 2 万亿参数模型的推理,千问自家的旗舰模型就跑在上面。DeepSeek 则秘密推进自研推理芯片约一年,专攻推理而非训练,已与多家芯片设计公司、晶圆代工厂及存储厂商接洽。
前三处的省法已经公开到人人可抄。第四行才刚拉开差距。