2026 年 8 月 26 日,两份模型卡先后出现在 Hugging Face 上。智谱把新模型叫 GLM-5.3-Flash,阿里通义千问把新模型叫 Qwen3.8-Flash-Next。[1][2] 两家都用了同一个词——Flash。

智谱在模型卡上给的口径很直接:多项基准超过上一代 GLM-5.2,价格是 GLM-5.2 的十分之一。[1]

不是打九折,不是季末促销,是把小数点往左挪一位。

结论先行

国产模型的低价不是补贴出来的。据 The Information 报道,DeepSeek 今年前七个月卖出一次 API 调用,扣掉直接成本后还能剩下 82.9%,厚过多数软件生意。[6][8] 价格能压到闭源模型的几十分之一,靠的是把一次调用里三段最贵的开销分别拆掉:叫醒的参数、注意力的账单、重复读过的前文。真正在流血的是另一格——同期约 110 亿元人民币的基建投入。[6]

「赔本赚吆喝」解释不了这张价目表

每百万 token 的标价如下(token 是模型处理文字的最小单位,一个汉字大致算一到两个),单位美元:

模型输入缓存命中输入输出
GLM-5.3-Flash(Z.ai 标价)0.150.030.50
DeepSeek V4 Flash(低峰)0.220.0070.66
DeepSeek V4 Flash(高峰)0.440.0141.32
Claude Opus 4.8525
GPT-5.6 Sol(促销价)420

闭源两家各有自己的缓存折扣口径,此处只对比标价。[3][4][12][13]

几个除法的结果是硬的:GLM-5.3-Flash 的输出价 0.50 美元对 Opus 4.8 的 25 美元,是五十分之一;输入价 0.15 美元对 5 美元,是三十三分之一。[1][4][12] 换成 GPT-5.6 Sol 的促销价当分母,输出仍差四十倍。[13] GLM-5.3-Flash 发布期另挂着限时五折,但那是促销,需要解释的是打折之前的标价本身。[4]

面对这种价差,市场有一个现成的解释:中国公司在打价格战,用亏损换份额,等对手撑不住再说。这个解释省事,而且过去十年在电商、网约车、共享单车上都验证过。

它在这里对不上账。据 The Information 报道,DeepSeek 今年前七个月的营收约 4.75 亿元人民币(约 6707 万美元),约为 2025 全年的十倍,而其中 API 业务的毛利率是 82.9%。[6][7][8] 一门赔本赚吆喝的生意,不会在最核心的那格上留下这样的数字。

钱是省出来的,不是贴出来的。省在三处。

第一处:320B 的模型,每个字只叫醒 18B

第一处最容易被误读——大家判断模型先认总参数,而总参数几乎不决定单次调用的成本。

MoE(混合专家)的思路是把一个大模型拆成很多小专家,每处理一个 token 只叫醒其中几个,其余的躺在显存里不动。DeepSeek 早在 DeepSeek-MoE 上就做过一个 16B 参数、每 token 只激活 2.7B 的版本,并在标准 MoE 之外加了一个「共享专家」——它永远在岗,负责通用能力;其余的「路由专家」按需上工,负责专门活。这样既缓解了专家忙闲不均,也避免几个专家学同一件事。

这一代的激活比压得更狠:

  • GLM-5.3-Flash:总参数 320B,每次激活 18B,约 5.6%。[1]
  • Qwen3.8-Flash-Next:总参数 125B,每 token 激活 6B,约 4.8%。共 512 个专家,每次叫醒 10 个路由专家外加 1 个始终在岗的共享专家。[2]
  • DeepSeek V4 Flash:以极低的参数激活比压低推理成本,被视为其性价比优势的核心。

省掉的是哪一笔?是每个 token 要走的矩阵乘法量。模型每吐一个字,要做的浮点运算大致跟着参与计算的参数走,而不是跟着摆在那里的参数走。320B 的模型和 18B 的模型,在这一笔账上是同一个量级。

落到价目表上,这是输出价能进到一美元以内的第一个前提。也是「模型很大」和「调用很便宜」这两件事能同时成立的原因。

这一处有个天花板:稀疏化省的是算力,不省显存——320B 的权重还是得整个装进机器。真正把长文本的成本咬住的,是下一笔。

第二处:把最贵的那种注意力限量供应

注意力是 Transformer 的核心动作:模型每生成一个字,都要回头看一遍前面已有的内容,判断哪些相关。标准做法是每个新字都跟全部旧字比一遍,开销随着长度按平方涨——上下文翻十倍,这笔账翻一百倍。

配套的还有 KV cache,即模型把读过的内容在显存里存成一份「备忘」,免得每次从头算。文本越长,这份备忘越占地方,而显存是推理成本里最贵的一块。

三家的解法不同,方向一致:让最贵的那种注意力少出场。

DeepSeek 走的是压缩路线。 V2 时代用多头潜在注意力(MLA)替代标准多头注意力,靠低秩近似把潜在向量压小,直接缩掉 KV cache 的体积。到 V4,改用 Token-wise Compression 配 DeepSeek Sparse Attention(DSA,一种选择性回看机制,让模型不必每个 token 都重读整段上下文),KV cache 可压缩 4 倍至 128 倍。[9][10] V4 另有约束稀疏注意力(CSA)与重度压缩注意力(HCA)两项改进。

Qwen 走的是配比路线,而且把比例写死在了架构里。Qwen3.8-Flash-Next 的 48 层中,每 4 层有 3 层走 Gated DeltaNet——线性注意力,开销随长度线性涨而非平方涨;只有 1 层走 Qwen Sparse Attention(QSA),在 micro-block 级别挑重点回看。算下来 36 层线性、12 层稀疏。[2] 更值得看的是头数:QSA 只有 2 个 KV 头,对着 24 个 Q 头——KV 头的数量直接决定那份「备忘」有多厚,而这里只留了两份。[2]

智谱走的是混用路线。 GLM-5.3-Flash 直接采用稀疏与线性注意力的混合架构,[1] 而 GLM-5 系列此前已集成过 DeepSeek 的 DSA 技术来压部署成本。三家还共用了一个不那么起眼的部件:mHC(Manifold-Constrained Hyper-Connections,一种强化残差连接、提升扩展效率的结构),DeepSeek V4 和 GLM-5.3-Flash 都在用。[1]

Qwen 还有一手更少见的账:51B 的 n-gram 嵌入参数,放在第 2 层,走 bigram 和 trigram(相邻两字、三字的固定组合)。[2] 这 51B 不计入那 6B 激活参数——因为嵌入表是出来的,不是出来的,它不参与每个 token 的矩阵乘法。相当于把「查得到的东西」从算力账挪进了存储账,而存储比算力便宜得多。

Qwen 这套配比集中在一张表里:

项目数字
总参数125B
每 token 激活6B(约 4.8%)
n-gram 嵌入参数51B(置于第 2 层,bigram / trigram)
多 token 预测(MTP,一次预测多个字的辅助模块)4B
专家配置512 个专家,每次激活 10 个路由专家 + 1 个共享专家
注意力配比每 4 层:3 层 Gated DeltaNet(线性)+ 1 层 QSA(稀疏),全模型 36 : 12
QSA 头数24 个 Q 头 / 2 个 KV 头
原生上下文262,144 token,可用 YaRN 扩展至 1,000,000

[2]

落到价目表上,这一处买来的是长上下文不再是加价项。GLM-5.3-Flash 的评测里最长用到 300,000 token,训练语料是 30T token 的多模态数据,也是 GLM-5 系列首个原生多模态模型。[1] 从前长文档要按天价计,现在跟短对话共用同一栏标价。

第三处:读过的前文,第二遍几乎不再收钱

前两处压的是算力和显存。第三处干脆把一部分工作整个取消。

一个 Agent 跑三十轮,每一轮都要把之前的对话、工具说明、文档原文重新发给模型;一份合同问十个问题,十次请求里有九成内容一模一样。传统做法是每次从头预填充一遍——同一段文字被反复读,反复收钱。

缓存命中就是服务器认出「这段前缀我算过」,直接调出中间结果接着往下走。价目表上的差距因此惊人:

  • DeepSeek V4 Flash 低峰时段,缓存命中输入每百万 token 收 0.007 美元,未命中收 0.22 美元,相差约 31 倍。[3]
  • GLM-5.3-Flash 是 0.03 美元对 0.15 美元,5 倍。[1][4]

命中率是这一处值多少钱的全部关键。据实验数据,DeepSeek V4 即使间隔 12 小时,缓存仍保持 100% 命中,这被视为其低价护城河的构成部分。12 小时意味着什么?昨晚放下的对话,今早接着问,前文那一段依然按 0.007 美元结算。

DeepSeek 还在 2026 年 8 月 16 日 16:00 UTC 起把统一价改成了分时计价:高峰是低峰的两倍,高峰时段为 UTC 01:00–04:00 与 06:00–10:00。[3] 价格开始跟着机器的忙闲走,这本身就是一句关于成本结构的自白——定价盯的不只是每次调用花了多少,还有那批机器有没有闲着。

三处的总账:

省在哪机制省掉的开销价目表上的落点
参数稀疏化MoE,只叫醒一小撮专家每 token 的矩阵乘法量按激活参数走320B / 125B 级模型的输出价能进到一美元以内
注意力稀疏 + 线性混合、KV cache 压缩长上下文的平方级算力与显存占用二十六万到三十万 token 的上下文不再单独加价
缓存命中重复前缀直接复用中间结果整段前文的重复预填充命中 0.007 美元对未命中 0.22 美元

对账:赚钱的是调用,亏钱的是产能

三处机制省下的钱,最终要落到一本真账上才算数。DeepSeek 那本账少见地被拆到了 API 这一格,数字出自 The Information 引述的匿名信源,公司未予确认。[6][7]

据该报道,2026 年前七个月:营收约 4.75 亿元人民币,约十倍于 2025 全年;API 业务毛利率 82.9%,公司整体毛利率 44.6%;净亏损约 7.15 亿元人民币,而 2025 全年净亏 9.35 亿元;同期投入 AI 基础设施约 110 亿元人民币,主要用于租用 AI 芯片服务器与采购算力设备,2025 全年这一项只有 12 亿元。[6][7][8]

毛利率是卖出一块钱的服务、扣掉直接成本后剩下多少。API 那一格 82.9%,说明这三处确实把单次调用的成本压到了标价的两成以内——这一格不但不亏,还厚过许多软件生意。

整体 44.6% 是另一回事。4.75 亿元乘 44.6%,整体毛利约 2.1 亿元,离 7.15 亿元的亏损差着一整层费用。而同期 110 亿元的基建投入,是营收的二十三倍多,是去年同一项的九倍多。

亏的不是调用,是产能。 那批机器,绝大部分还没开始产生营收——有的刚上电,有的还在路上,有的对应的是 DeepSeek 正在内蒙古乌兰察布筹建的 1GW 级数据中心,据彭博社报道其部分算力预计在 2027 年底或 2028 年初才投运。训练、研发、折旧摆在账的另一侧,靠 4.75 亿元量级的营收去追。

这也正是降价还能继续的原因。单次调用那一格留着的空间还厚,成本曲线还在往下走,产能上来之后固定成本被摊得更薄——每一项都指向同一个方向。一个单点更直白:DeepSeek-V4-Flash-0731 在 ARC-AGI-2 基准下的单任务成本仅 0.042 美元,与 GPT-5.6-Luna-0730 成绩相近但成本低 4 倍多,被认为留有较大调价空间。

同一份报道还写到,DeepSeek 正在推进第二轮融资,目标募资 500 亿元人民币、估值 5000 亿元人民币,并在筹备上海 IPO。[6][7] 一门单次调用毛利这么厚的生意,去募一笔相当于其前七个月营收一百倍的钱——两个数字放在一起,就是这门生意当下的全部张力:赚钱的部分很赚,要养的部分很大。

账单上的第四行

这三处有一个共同点:全都写在公开的模型卡和技术报告里。MoE 的激活比、注意力的层间配比、KV cache 压多少倍、缓存命中窗口有多长——权重开源,论文可读,代码可跑。GLM-5 集成 DeepSeek 的 DSA,Qwen3.8-Flash-Next 把 DeepSeek-V4-Flash 直接列进对比基准。[2]

一条谁都能走的路,撑不起护城河,只能算新的地板。

而账单上还有第四行,三家刚开始各走各的——芯片本身。阿里云自研的真武 M890 已经上线并开始规模化销售,其超节点实例支持超 2 万亿参数模型的推理,千问自家的旗舰模型就跑在上面。DeepSeek 则秘密推进自研推理芯片约一年,专攻推理而非训练,已与多家芯片设计公司、晶圆代工厂及存储厂商接洽。

前三处的省法已经公开到人人可抄。第四行才刚拉开差距。