2026 年 8 月 26 日,两份模型卡先后出现在 Hugging Face 上。智谱把新模型叫 GLM-5.3-Flash,阿里通义千问把新模型叫 Qwen3.8-Flash-Next。[1][2] 两家都用了同一个词——Flash。
智谱在模型卡上给的口径很直接:多项基准超过上一代 GLM-5.2,价格是 GLM-5.2 的十分之一。[1]
不是打九折,不是季末促销,是把小数点往左挪一位。
结论先行
国产模型的低价不是补贴出来的。据 The Information 报道,DeepSeek 今年前七个月卖出一次 API 调用,扣掉直接成本后还能剩下 82.9%,厚过多数软件生意。[6][8] 一次调用里三段最贵的开销被分别拆掉——叫醒的参数、注意力的账单、重复读过的前文——把推理的成本地板压到了极低的位置。
但这三处闭源大厂同样在用,所以它们解释不了价差。把价目表按档位拆开更清楚:小杯档对小杯档双方基本打平,闭源的缓存命中价甚至更便宜;差价几乎整个压在旗舰档上——DeepSeek 自家旗舰 V4 Pro 低峰卖 0.66 / 1.98 美元,Claude Opus 4.8 卖 5 / 25。[3][12]
分水岭不在工程,在权重开不开源:开源的旗舰谁都能托管,价格被竞争摁回成本附近,卖不出旗舰价;专有的旗舰只有一个卖家,可以按价值定价。三处机制决定地板在哪,权重开不开源决定谁被摁在地板上。
真正在流血的还是另一格——同期约 110 亿元人民币的基建投入。[6]
「赔本赚吆喝」解释不了这张价目表
每百万 token 的标价如下(token 是模型处理文字的最小单位,一个汉字大致算一到两个),单位美元:
| 档位 | 模型 | 输入 | 缓存命中输入 | 输出 |
|---|---|---|---|---|
| 小杯 | GLM-5.3-Flash(Z.ai 标价) | 0.15 | 0.03 | 0.50 |
| 小杯 | DeepSeek V4 Flash(低峰) | 0.22 | 0.007 | 0.66 |
| 小杯 | GPT-5.6 Luna | 0.20 | 0.02 | 1.20 |
| 小杯 | Claude Haiku 4.5 | 1 | 0.10 | 5 |
| 旗舰 | DeepSeek V4 Pro(低峰) | 0.66 | 0.022 | 1.98 |
| 旗舰 | GPT-5.6 Sol | 4 | 0.40 | 20 |
| 旗舰 | Claude Opus 4.8 | 5 | 0.50 | 25 |
DeepSeek 两档均为低峰价,高峰翻倍;GPT-5.6 两档为标准层短上下文价。[3][13] Claude 的缓存命中价按官方口径换算:读取按基础输入价的十分之一计,写入按 1.25 倍;另有 Batch API 异步批处理一律五折。[12]
先说那个最惹眼的除法:GLM-5.3-Flash 的输出价 0.50 美元对 Opus 4.8 的 25 美元,是五十分之一;输入价 0.15 对 5,是三十三分之一。[1][4][12](GLM-5.3-Flash 发布期另挂着限时五折,但那是促销,需要解释的是打折之前的标价本身。[4])
但这个五十倍几乎全部是拿小杯比旗舰比出来的。把表按档位拆开,故事完全变了:
小杯档对小杯档,基本打平。 GPT-5.6 Luna 的输入 0.20 美元对 GLM-5.3-Flash 的 0.15,只贵三成;输出 1.20 对 0.50,两倍出头。[1][13] 而缓存命中输入是 0.02 对 0.03——闭源那边反而更便宜。[1][4][13]
旗舰档对旗舰档,差 8 到 13 倍。 DeepSeek 自家的旗舰 V4 Pro 低峰价是 0.66 / 1.98 美元,对 Opus 4.8 的 5 / 25,输入差 7.6 倍、输出差 12.6 倍;缓存命中那格 0.022 对 0.50,差 23 倍。[3][12]
差价不是均匀分布的,它整个压在旗舰档上。 这一条把问题彻底改写了——需要解释的从来不是「美国的 token 为什么贵五十倍」,同档根本没贵这么多;真正要解释的是:为什么开源那边连旗舰都卖不出旗舰价?
面对这种价差,市场有一个现成的解释:中国公司在打价格战,用亏损换份额,等对手撑不住再说。这个解释省事,而且过去十年在电商、网约车、共享单车上都验证过。
它在这里对不上账。据 The Information 报道,DeepSeek 今年前七个月的营收约 4.75 亿元人民币(约 6707 万美元),约为 2025 全年的十倍,而其中 API 业务的毛利率是 82.9%。[6][7][8] 一门赔本赚吆喝的生意,不会在最核心的那格上留下这样的数字。
钱是省出来的,不是贴出来的。省在三处。
接下来三节先说清楚这个价格的地板是怎么压下去的;地板之上剩的那几倍是另一回事,留到后面再拆。
第一处:320B 的模型,每个字只叫醒 18B
第一处最容易被误读——大家判断模型先认总参数,而总参数几乎不决定单次调用的成本。
MoE(混合专家)的思路是把一个大模型拆成很多小专家,每处理一个 token 只叫醒其中几个,其余的躺在显存里不动。DeepSeek 早在 DeepSeek-MoE 上就做过一个 16B 参数、每 token 只激活 2.7B 的版本,并在标准 MoE 之外加了一个「共享专家」——它永远在岗,负责通用能力;其余的「路由专家」按需上工,负责专门活。这样既缓解了专家忙闲不均,也避免几个专家学同一件事。
这一代的激活比压得更狠:
- GLM-5.3-Flash:总参数 320B,每次激活 18B,约 5.6%。[1]
- Qwen3.8-Flash-Next:总参数 125B,每 token 激活 6B,约 4.8%。共 512 个专家,每次叫醒 10 个路由专家外加 1 个始终在岗的共享专家。[2]
- DeepSeek V4 Flash:以极低的参数激活比压低推理成本,被视为其性价比优势的核心。
省掉的是哪一笔?是每个 token 要走的矩阵乘法量。模型每吐一个字,要做的浮点运算大致跟着参与计算的参数走,而不是跟着摆在那里的参数走。320B 的模型和 18B 的模型,在这一笔账上是同一个量级。
落到价目表上,这是输出价能进到一美元以内的第一个前提。也是「模型很大」和「调用很便宜」这两件事能同时成立的原因。
这一处有个天花板:稀疏化省的是算力,不省显存——320B 的权重还是得整个装进机器。真正把长文本的成本咬住的,是下一笔。
第二处:把最贵的那种注意力限量供应
注意力是 Transformer 的核心动作:模型每生成一个字,都要回头看一遍前面已有的内容,判断哪些相关。标准做法是每个新字都跟全部旧字比一遍,开销随着长度按平方涨——上下文翻十倍,这笔账翻一百倍。
配套的还有 KV cache,即模型把读过的内容在显存里存成一份「备忘」,免得每次从头算。文本越长,这份备忘越占地方,而显存是推理成本里最贵的一块。
三家的解法不同,方向一致:让最贵的那种注意力少出场。
DeepSeek 走的是压缩路线。 V2 时代用多头潜在注意力(MLA)替代标准多头注意力,靠低秩近似把潜在向量压小,直接缩掉 KV cache 的体积。到 V4,改用 Token-wise Compression 配 DeepSeek Sparse Attention(DSA,一种选择性回看机制,让模型不必每个 token 都重读整段上下文),KV cache 可压缩 4 倍至 128 倍。[9][10] V4 另有约束稀疏注意力(CSA)与重度压缩注意力(HCA)两项改进。
Qwen 走的是配比路线,而且把比例写死在了架构里。Qwen3.8-Flash-Next 的 48 层中,每 4 层有 3 层走 Gated DeltaNet——线性注意力,开销随长度线性涨而非平方涨;只有 1 层走 Qwen Sparse Attention(QSA),在 micro-block 级别挑重点回看。算下来 36 层线性、12 层稀疏。[2] 更值得看的是头数:QSA 只有 2 个 KV 头,对着 24 个 Q 头——KV 头的数量直接决定那份「备忘」有多厚,而这里只留了两份。[2]
智谱走的是混用路线。 GLM-5.3-Flash 直接采用稀疏与线性注意力的混合架构,[1] 而 GLM-5 系列此前已集成过 DeepSeek 的 DSA 技术来压部署成本。三家还共用了一个不那么起眼的部件:mHC(Manifold-Constrained Hyper-Connections,一种强化残差连接、提升扩展效率的结构),DeepSeek V4 和 GLM-5.3-Flash 都在用。[1]
Qwen 还有一手更少见的账:51B 的 n-gram 嵌入参数,放在第 2 层,走 bigram 和 trigram(相邻两字、三字的固定组合)。[2] 这 51B 不计入那 6B 激活参数——因为嵌入表是查出来的,不是算出来的,它不参与每个 token 的矩阵乘法。相当于把「查得到的东西」从算力账挪进了存储账,而存储比算力便宜得多。
Qwen 这套配比集中在一张表里:
| 项目 | 数字 |
|---|---|
| 总参数 | 125B |
| 每 token 激活 | 6B(约 4.8%) |
| n-gram 嵌入参数 | 51B(置于第 2 层,bigram / trigram) |
| 多 token 预测(MTP,一次预测多个字的辅助模块) | 4B |
| 专家配置 | 512 个专家,每次激活 10 个路由专家 + 1 个共享专家 |
| 注意力配比 | 每 4 层:3 层 Gated DeltaNet(线性)+ 1 层 QSA(稀疏),全模型 36 : 12 |
| QSA 头数 | 24 个 Q 头 / 2 个 KV 头 |
| 原生上下文 | 262,144 token,可用 YaRN 扩展至 1,000,000 |
[2]
落到价目表上,这一处买来的是长上下文不再是加价项。GLM-5.3-Flash 的评测里最长用到 300,000 token,训练语料是 30T token 的多模态数据,也是 GLM-5 系列首个原生多模态模型。[1] 从前长文档要按天价计,现在跟短对话共用同一栏标价。
第三处:读过的前文,第二遍几乎不再收钱
前两处压的是算力和显存。第三处干脆把一部分工作整个取消。
一个 Agent 跑三十轮,每一轮都要把之前的对话、工具说明、文档原文重新发给模型;一份合同问十个问题,十次请求里有九成内容一模一样。传统做法是每次从头预填充一遍——同一段文字被反复读,反复收钱。
缓存命中就是服务器认出「这段前缀我算过」,直接调出中间结果接着往下走。价目表上的差距因此惊人:
- DeepSeek V4 Flash 低峰时段,缓存命中输入每百万 token 收 0.007 美元,未命中收 0.22 美元,相差约 31 倍。[3]
- GLM-5.3-Flash 是 0.03 美元对 0.15 美元,5 倍。[1][4]
命中率是这一处值多少钱的全部关键。据实验数据,DeepSeek V4 即使间隔 12 小时,缓存仍保持 100% 命中,这被视为其低价护城河的构成部分。12 小时意味着什么?昨晚放下的对话,今早接着问,前文那一段依然按 0.007 美元结算。
DeepSeek 还在 2026 年 8 月 16 日 16:00 UTC 起把统一价改成了分时计价:高峰是低峰的两倍,高峰时段为 UTC 01:00–04:00 与 06:00–10:00。[3] 价格开始跟着机器的忙闲走,这本身就是一句关于成本结构的自白——定价盯的不只是每次调用花了多少,还有那批机器有没有闲着。
三处的总账:
| 省在哪 | 机制 | 省掉的开销 | 价目表上的落点 |
|---|---|---|---|
| 参数稀疏化 | MoE,只叫醒一小撮专家 | 每 token 的矩阵乘法量按激活参数走 | 320B / 125B 级模型的输出价能进到一美元以内 |
| 注意力 | 稀疏 + 线性混合、KV cache 压缩 | 长上下文的平方级算力与显存占用 | 二十六万到三十万 token 的上下文不再单独加价 |
| 缓存命中 | 重复前缀直接复用中间结果 | 整段前文的重复预填充 | 命中 0.007 美元对未命中 0.22 美元 |
对账:赚钱的是调用,亏钱的是产能
三处机制省下的钱,最终要落到一本真账上才算数。DeepSeek 那本账少见地被拆到了 API 这一格,数字出自 The Information 引述的匿名信源,公司未予确认。[6][7]
据该报道,2026 年前七个月:营收约 4.75 亿元人民币,约十倍于 2025 全年;API 业务毛利率 82.9%,公司整体毛利率 44.6%;净亏损约 7.15 亿元人民币,而 2025 全年净亏 9.35 亿元;同期投入 AI 基础设施约 110 亿元人民币,主要用于租用 AI 芯片服务器与采购算力设备,2025 全年这一项只有 12 亿元。[6][7][8]
毛利率是卖出一块钱的服务、扣掉直接成本后剩下多少。API 那一格 82.9%,说明这三处确实把单次调用的成本压到了标价的两成以内——这一格不但不亏,还厚过许多软件生意。
整体 44.6% 是另一回事。4.75 亿元乘 44.6%,整体毛利约 2.1 亿元,离 7.15 亿元的亏损差着一整层费用。而同期 110 亿元的基建投入,是营收的二十三倍多,是去年同一项的九倍多。
亏的不是调用,是产能。 那批机器,绝大部分还没开始产生营收——有的刚上电,有的还在路上,有的对应的是 DeepSeek 正在内蒙古乌兰察布筹建的 1GW 级数据中心,据彭博社报道其部分算力预计在 2027 年底或 2028 年初才投运。训练、研发、折旧摆在账的另一侧,靠 4.75 亿元量级的营收去追。
这也正是降价还能继续的原因。单次调用那一格留着的空间还厚,成本曲线还在往下走,产能上来之后固定成本被摊得更薄——每一项都指向同一个方向。一个单点更直白:DeepSeek-V4-Flash-0731 在 ARC-AGI-2 基准下的单任务成本仅 0.042 美元,与 GPT-5.6-Luna-0730 成绩相近但成本低 4 倍多,被认为留有较大调价空间。
同一份报道还写到,DeepSeek 正在推进第二轮融资,目标募资 500 亿元人民币、估值 5000 亿元人民币,并在筹备上海 IPO。[6][7] 一门单次调用毛利这么厚的生意,去募一笔相当于其前七个月营收一百倍的钱——两个数字放在一起,就是这门生意当下的全部张力:赚钱的部分很赚,要养的部分很大。
三处机制是地板,不是价签
这三处有一个共同点:全都写在公开的模型卡和技术报告里。MoE 的激活比、注意力的层间配比、KV cache 压多少倍、缓存命中窗口有多长——权重开源,论文可读,代码可跑。GLM-5 集成 DeepSeek 的 DSA,Qwen3.8-Flash-Next 把 DeepSeek-V4-Flash 直接列进对比基准。[2]
公开到这个程度,就意味着闭源那边不可能没在用。缓存复用那一处是明着的:Anthropic 的缓存读取按基础输入价的十分之一计,Batch API 异步批处理再打五折。[12] MoE 那一处两家都不公开架构,无从直接核对,但按小杯档的价位和吞吐倒推,稠密架构几乎无从成立。至于注意力改造,闭源两家确实落后一个代际——原因不是没抄,是这类改动只能在下一次预训练里落地,没法热更到已经训好的权重上,外界看到的永远是一个训练周期的滞后。
于是问题就变了。一个双方共有的因素,解释不了双方的差异。 三处机制回答的是「推理为什么可以便宜」,不是「中国为什么比美国便宜」。
它们决定的是地板在哪。决定谁站在地板上的,是另一件事。
权重公开的那一刻,价格就不归你定了
GLM-5.3-Flash、Qwen3.8-Flash-Next、DeepSeek——这几个模型的权重全是公开的。任何人下载下来都能自己托管,OpenRouter 上一个 GLM 同时挂着好几家供应商。[4]
这件事对价格的后果是决定性的:权重一旦公开,API 价格就成了商品化托管的竞争价。 Z.ai 敢往上加,别家就能用同一份权重把它打下去。价格只能向服务成本收敛,收敛得多快取决于有几家在托管。
Claude Opus 只有一个卖家。Anthropic 对自己的权重是独占的,没有第二个人能提供同样的东西,价格因此按价值定,而不按成本定。一个旁证:同一家公司同时卖 25 美元和 5 美元的输出(Opus 对 Haiku),说明它完全有能力把 token 卖便宜——旗舰的高价是定位选择,不是成本天花板。
回到那张按档位拆开的价目表,三行观察各自对应一句解释:
| 观察 | 解释 |
|---|---|
| 小杯档双方基本打平(Luna 0.20 / 1.20 对 GLM-Flash 0.15 / 0.50) | 三处机制是共有的地板,两边都站在上面 |
| 闭源有 5 / 25 美元的旗舰档 | 权重专有、独家卖方,可以按价值定价 |
| 开源的旗舰只卖到 0.66 / 1.98 | 权重公开、谁都能托管,价格压不住 |
还有两项次要的:真实成本差(电价、自建与云上租卡、注意力架构落后一个代际)大约两三倍,是实打实的、不是账面调整能变出来的;产能配给容易被漏掉——在卡最紧的时候,降价只会让容量更早耗尽,还会挤掉自家更值钱的用途,训下一代模型、跑自家的 agent 产品。高价在这里起的是闸门作用。
但这两项都不足以撑起旗舰档那 8 到 13 倍,而且它们在小杯档上同样存在——小杯档却没有拉开差距。能同时解释「小杯打平、旗舰差十倍」的,只有权重开不开源这一条。
这里还剩一个乍看别扭的地方:既然开源权重把价格摁回成本,DeepSeek 怎么还能在那么低的价上留住 82.9% 的毛利?因为开源设的是天花板、不是地板——你不能比第三方托管贵太多,但在天花板底下,自家的推理栈跟自家架构是共同设计的、缓存命中率也最高,那点差距就是留下来的毛利。
账单上的第四行
前三处已经公开到人人可抄,第四处刚刚开始各走各的——芯片本身。阿里云自研的真武 M890 已经上线并开始规模化销售,其超节点实例支持超 2 万亿参数模型的推理,千问自家的旗舰模型就跑在上面。DeepSeek 则秘密推进自研推理芯片约一年,专攻推理而非训练,已与多家芯片设计公司、晶圆代工厂及存储厂商接洽。
三处省法是共同的地板,权重开不开源决定谁站在地板上。而第四行才刚拉开差距。