2026 年 8 月 26 日,兩份模型卡先後出現在 Hugging Face 上。智譜把新模型叫 GLM-5.3-Flash,阿里通義千問把新模型叫 Qwen3.8-Flash-Next。[1][2] 兩家都用了同一個詞——Flash。

智譜在模型卡上給的口徑很直接:多項基準超過上一代 GLM-5.2,價格是 GLM-5.2 的十分之一。[1]

不是打九折,不是季末促銷,是把小數點往左挪一位。

結論先行

國產模型的低價不是補貼出來的。據 The Information 報道,DeepSeek 今年前七個月賣出一次 API 呼叫,扣掉直接成本後還能剩下 82.9%,厚過多數軟體生意。[6][8] 價格能壓到閉源模型的幾十分之一,靠的是把一次呼叫裡三段最貴的開銷分別拆掉:叫醒的引數、注意力的賬單、重複讀過的前文。真正在流血的是另一格——同期約 110 億元人民幣的基建投入。[6]

「賠本賺吆喝」解釋不了這張價目表

每百萬 token 的標價如下(token 是模型處理文字的最小單位,一個漢字大致算一到兩個),單位美元:

模型輸入快取命中輸入輸出
GLM-5.3-Flash(Z.ai 標價)0.150.030.50
DeepSeek V4 Flash(低峰)0.220.0070.66
DeepSeek V4 Flash(高峰)0.440.0141.32
Claude Opus 4.8525
GPT-5.6 Sol(促銷價)420

閉源兩家各有自己的緩存摺扣口徑,此處只對比標價。[3][4][12][13]

幾個除法的結果是硬的:GLM-5.3-Flash 的輸出價 0.50 美元對 Opus 4.8 的 25 美元,是五十分之一;輸入價 0.15 美元對 5 美元,是三十三分之一。[1][4][12] 換成 GPT-5.6 Sol 的促銷價當分母,輸出仍差四十倍。[13] GLM-5.3-Flash 釋出期另掛著限時五折,但那是促銷,需要解釋的是打折之前的標價本身。[4]

面對這種價差,市場有一個現成的解釋:中國公司在打價格戰,用虧損換份額,等對手撐不住再說。這個解釋省事,而且過去十年在電商、網約車、共享單車上都驗證過。

它在這裡對不上賬。據 The Information 報道,DeepSeek 今年前七個月的營收約 4.75 億元人民幣(約 6707 萬美元),約為 2025 全年的十倍,而其中 API 業務的毛利率是 82.9%。[6][7][8] 一門賠本賺吆喝的生意,不會在最核心的那格上留下這樣的數字。

錢是省出來的,不是貼出來的。省在三處。

第一處:320B 的模型,每個字只叫醒 18B

第一處最容易被誤讀——大家判斷模型先認總引數,而總引數幾乎不決定單次呼叫的成本。

MoE(混合專家)的思路是把一個大模型拆成很多小專家,每處理一個 token 只叫醒其中幾個,其餘的躺在視訊記憶體裡不動。DeepSeek 早在 DeepSeek-MoE 上就做過一個 16B 引數、每 token 只啟用 2.7B 的版本,並在標準 MoE 之外加了一個「共享專家」——它永遠在崗,負責通用能力;其餘的「路由專家」按需上工,負責專門活。這樣既緩解了專家忙閒不均,也避免幾個專家學同一件事。

這一代的啟用比壓得更狠:

  • GLM-5.3-Flash:總引數 320B,每次啟用 18B,約 5.6%。[1]
  • Qwen3.8-Flash-Next:總引數 125B,每 token 啟用 6B,約 4.8%。共 512 個專家,每次叫醒 10 個路由專家外加 1 個始終在崗的共享專家。[2]
  • DeepSeek V4 Flash:以極低的引數啟用比壓低推理成本,被視為其價效比優勢的核心。

省掉的是哪一筆?是每個 token 要走的矩陣乘法量。模型每吐一個字,要做的浮點運算大致跟著參與計算的引數走,而不是跟著擺在那裡的引數走。320B 的模型和 18B 的模型,在這一筆賬上是同一個量級。

落到價目表上,這是輸出價能進到一美元以內的第一個前提。也是「模型很大」和「呼叫很便宜」這兩件事能同時成立的原因。

這一處有個天花板:稀疏化省的是算力,不省視訊記憶體——320B 的權重還是得整個裝進機器。真正把長文本的成本咬住的,是下一筆。

第二處:把最貴的那種注意力限量供應

注意力是 Transformer 的核心動作:模型每生成一個字,都要回頭看一遍前面已有的內容,判斷哪些相關。標準做法是每個新字都跟全部舊字比一遍,開銷隨著長度按平方漲——上下文翻十倍,這筆賬翻一百倍。

配套的還有 KV cache,即模型把讀過的內容在視訊記憶體裡存成一份「備忘」,免得每次從頭算。文本越長,這份備忘越佔地方,而視訊記憶體是推理成本里最貴的一塊。

三家的解法不同,方向一致:讓最貴的那種注意力少出場。

DeepSeek 走的是壓縮路線。 V2 時代用多頭潛在注意力(MLA)替代標準多頭注意力,靠低秩近似把潛在向量壓小,直接縮掉 KV cache 的體積。到 V4,改用 Token-wise Compression 配 DeepSeek Sparse Attention(DSA,一種選擇性回看機制,讓模型不必每個 token 都重讀整段上下文),KV cache 可壓縮 4 倍至 128 倍。[9][10] V4 另有約束稀疏注意力(CSA)與重度壓縮注意力(HCA)兩項改進。

Qwen 走的是配比路線,而且把比例寫死在了架構裡。Qwen3.8-Flash-Next 的 48 層中,每 4 層有 3 層走 Gated DeltaNet——線性注意力,開銷隨長度線性漲而非平方漲;只有 1 層走 Qwen Sparse Attention(QSA),在 micro-block 級別挑重點回看。算下來 36 層線性、12 層稀疏。[2] 更值得看的是頭數:QSA 只有 2 個 KV 頭,對著 24 個 Q 頭——KV 頭的數量直接決定那份「備忘」有多厚,而這裡只留了兩份。[2]

智譜走的是混用路線。 GLM-5.3-Flash 直接採用稀疏與線性注意力的混合架構,[1] 而 GLM-5 系列此前已整合過 DeepSeek 的 DSA 技術來壓部署成本。三家還共用了一個不那麼起眼的部件:mHC(Manifold-Constrained Hyper-Connections,一種強化殘差連線、提升擴充套件效率的結構),DeepSeek V4 和 GLM-5.3-Flash 都在用。[1]

Qwen 還有一手更少見的賬:51B 的 n-gram 嵌入引數,放在第 2 層,走 bigram 和 trigram(相鄰兩字、三字的固定組合)。[2] 這 51B 不計入那 6B 啟用引數——因為嵌入表是出來的,不是出來的,它不參與每個 token 的矩陣乘法。相當於把「查得到的東西」從算力賬挪進了儲存賬,而儲存比算力便宜得多。

Qwen 這套配比集中在一張表裡:

專案數字
總引數125B
每 token 啟用6B(約 4.8%)
n-gram 嵌入引數51B(置於第 2 層,bigram / trigram)
多 token 預測(MTP,一次預測多個字的輔助模組)4B
專家配置512 個專家,每次啟用 10 個路由專家 + 1 個共享專家
注意力配比每 4 層:3 層 Gated DeltaNet(線性)+ 1 層 QSA(稀疏),全模型 36 : 12
QSA 頭數24 個 Q 頭 / 2 個 KV 頭
原生上下文262,144 token,可用 YaRN 擴充套件至 1,000,000

[2]

落到價目表上,這一處買來的是長上下文不再是加價項。GLM-5.3-Flash 的評測裡最長用到 300,000 token,訓練語料是 30T token 的多模態資料,也是 GLM-5 系列首個原生多模態模型。[1] 從前長文件要按天價計,現在跟短對話共用同一欄標價。

第三處:讀過的前文,第二遍幾乎不再收錢

前兩處壓的是算力和視訊記憶體。第三處乾脆把一部分工作整個取消。

一個 Agent 跑三十輪,每一輪都要把之前的對話、工具說明、文件原文重新發給模型;一份合同問十個問題,十次請求裡有九成內容一模一樣。傳統做法是每次從頭預填充一遍——同一段文字被反覆讀,反覆收錢。

快取命中就是伺服器認出「這段字首我算過」,直接調出中間結果接著往下走。價目表上的差距因此驚人:

  • DeepSeek V4 Flash 低峰時段,快取命中輸入每百萬 token 收 0.007 美元,未命中收 0.22 美元,相差約 31 倍。[3]
  • GLM-5.3-Flash 是 0.03 美元對 0.15 美元,5 倍。[1][4]

命中率是這一處值多少錢的全部關鍵。據實驗資料,DeepSeek V4 即使間隔 12 小時,快取仍保持 100% 命中,這被視為其低價護城河的構成部分。12 小時意味著什麼?昨晚放下的對話,今早接著問,前文那一段依然按 0.007 美元結算。

DeepSeek 還在 2026 年 8 月 16 日 16:00 UTC 起把統一價改成了分時計價:高峰是低峰的兩倍,高峰時段為 UTC 01:00–04:00 與 06:00–10:00。[3] 價格開始跟著機器的忙閒走,這本身就是一句關於成本結構的自白——定價盯的不只是每次呼叫花了多少,還有那批機器有沒有閒著。

三處的總賬:

省在哪機制省掉的開銷價目表上的落點
引數稀疏化MoE,只叫醒一小撮專家每 token 的矩陣乘法量按啟用引數走320B / 125B 級模型的輸出價能進到一美元以內
注意力稀疏 + 線性混合、KV cache 壓縮長上下文的平方級算力與視訊記憶體佔用二十六萬到三十萬 token 的上下文不再單獨加價
快取命中重複字首直接複用中間結果整段前文的重複預填充命中 0.007 美元對未命中 0.22 美元

對賬:賺錢的是呼叫,虧錢的是產能

三處機制省下的錢,最終要落到一本真賬上才算數。DeepSeek 那本賬少見地被拆到了 API 這一格,數字出自 The Information 引述的匿名信源,公司未予確認。[6][7]

據該報道,2026 年前七個月:營收約 4.75 億元人民幣,約十倍於 2025 全年;API 業務毛利率 82.9%,公司整體毛利率 44.6%;淨虧損約 7.15 億元人民幣,而 2025 全年淨虧 9.35 億元;同期投入 AI 基礎設施約 110 億元人民幣,主要用於租用 AI 晶片伺服器與採購算力裝置,2025 全年這一項只有 12 億元。[6][7][8]

毛利率是賣出一塊錢的服務、扣掉直接成本後剩下多少。API 那一格 82.9%,說明這三處確實把單次呼叫的成本壓到了標價的兩成以內——這一格不但不虧,還厚過許多軟體生意。

整體 44.6% 是另一回事。4.75 億元乘 44.6%,整體毛利約 2.1 億元,離 7.15 億元的虧損差著一整層費用。而同期 110 億元的基建投入,是營收的二十三倍多,是去年同一項的九倍多。

虧的不是呼叫,是產能。 那批機器,絕大部分還沒開始產生營收——有的剛上電,有的還在路上,有的對應的是 DeepSeek 正在內蒙古烏蘭察布籌建的 1GW 級資料中心,據彭博社報道其部分算力預計在 2027 年底或 2028 年初才投運。訓練、研發、折舊擺在賬的另一側,靠 4.75 億元量級的營收去追。

這也正是降價還能繼續的原因。單次呼叫那一格留著的空間還厚,成本曲線還在往下走,產能上來之後固定成本被攤得更薄——每一項都指向同一個方向。一個單點更直白:DeepSeek-V4-Flash-0731 在 ARC-AGI-2 基準下的單任務成本僅 0.042 美元,與 GPT-5.6-Luna-0730 成績相近但成本低 4 倍多,被認為留有較大調價空間。

同一份報道還寫到,DeepSeek 正在推進第二輪融資,目標募資 500 億元人民幣、估值 5000 億元人民幣,並在籌備上海 IPO。[6][7] 一門單次呼叫毛利這麼厚的生意,去募一筆相當於其前七個月營收一百倍的錢——兩個數字放在一起,就是這門生意當下的全部張力:賺錢的部分很賺,要養的部分很大。

賬單上的第四行

這三處有一個共同點:全都寫在公開的模型卡和技術報告裡。MoE 的啟用比、注意力的層間配比、KV cache 壓多少倍、快取命中視窗有多長——權重開源,論文可讀,程式碼可跑。GLM-5 整合 DeepSeek 的 DSA,Qwen3.8-Flash-Next 把 DeepSeek-V4-Flash 直接列進對比基準。[2]

一條誰都能走的路,撐不起護城河,只能算新的地板。

而賬單上還有第四行,三家剛開始各走各的——晶片本身。阿里雲自研的真武 M890 已經上線並開始規模化銷售,其超節點例項支援超 2 萬億引數模型的推理,千問自家的旗艦模型就跑在上面。DeepSeek 則秘密推進自研推理晶片約一年,專攻推理而非訓練,已與多家晶片設計公司、晶圓代工廠及儲存廠商接洽。

前三處的省法已經公開到人人可抄。第四行才剛拉開差距。