2026 年 8 月 26 日,兩份模型卡先後出現在 Hugging Face 上。智譜把新模型叫 GLM-5.3-Flash,阿里通義千問把新模型叫 Qwen3.8-Flash-Next。[1][2] 兩家都用了同一個詞——Flash。
智譜在模型卡上給的口徑很直接:多項基準超過上一代 GLM-5.2,價格是 GLM-5.2 的十分之一。[1]
不是打九折,不是季末促銷,是把小數點往左挪一位。
結論先行
國產模型的低價不是補貼出來的。據 The Information 報道,DeepSeek 今年前七個月賣出一次 API 呼叫,扣掉直接成本後還能剩下 82.9%,厚過多數軟體生意。[6][8] 一次呼叫裡三段最貴的開銷被分別拆掉——叫醒的引數、注意力的賬單、重複讀過的前文——把推理的成本地板壓到了極低的位置。
但這三處閉源大廠同樣在用,所以它們解釋不了價差。把價目表按檔位拆開更清楚:小杯檔對小杯檔雙方基本打平,閉源的快取命中價甚至更便宜;差價幾乎整個壓在旗艦檔上——DeepSeek 自家旗艦 V4 Pro 低峰賣 0.66 / 1.98 美元,Claude Opus 4.8 賣 5 / 25。[3][12]
分水嶺不在工程,在權重開不開源:開源的旗艦誰都能託管,價格被競爭摁回成本附近,賣不出旗艦價;專有的旗艦隻有一個賣家,可以按價值定價。三處機制決定地板在哪,權重開不開源決定誰被摁在地板上。
真正在流血的還是另一格——同期約 110 億元人民幣的基建投入。[6]
「賠本賺吆喝」解釋不了這張價目表
每百萬 token 的標價如下(token 是模型處理文字的最小單位,一個漢字大致算一到兩個),單位美元:
| 檔位 | 模型 | 輸入 | 快取命中輸入 | 輸出 |
|---|---|---|---|---|
| 小杯 | GLM-5.3-Flash(Z.ai 標價) | 0.15 | 0.03 | 0.50 |
| 小杯 | DeepSeek V4 Flash(低峰) | 0.22 | 0.007 | 0.66 |
| 小杯 | GPT-5.6 Luna | 0.20 | 0.02 | 1.20 |
| 小杯 | Claude Haiku 4.5 | 1 | 0.10 | 5 |
| 旗艦 | DeepSeek V4 Pro(低峰) | 0.66 | 0.022 | 1.98 |
| 旗艦 | GPT-5.6 Sol | 4 | 0.40 | 20 |
| 旗艦 | Claude Opus 4.8 | 5 | 0.50 | 25 |
DeepSeek 兩檔均為低峰價,高峰翻倍;GPT-5.6 兩檔為標準層短上下文價。[3][13] Claude 的快取命中價按官方口徑換算:讀取按基礎輸入價的十分之一計,寫入按 1.25 倍;另有 Batch API 非同步批處理一律五折。[12]
先說那個最惹眼的除法:GLM-5.3-Flash 的輸出價 0.50 美元對 Opus 4.8 的 25 美元,是五十分之一;輸入價 0.15 對 5,是三十三分之一。[1][4][12](GLM-5.3-Flash 釋出期另掛著限時五折,但那是促銷,需要解釋的是打折之前的標價本身。[4])
但這個五十倍幾乎全部是拿小杯比旗艦比出來的。把表按檔位拆開,故事完全變了:
小杯檔對小杯檔,基本打平。 GPT-5.6 Luna 的輸入 0.20 美元對 GLM-5.3-Flash 的 0.15,只貴三成;輸出 1.20 對 0.50,兩倍出頭。[1][13] 而快取命中輸入是 0.02 對 0.03——閉源那邊反而更便宜。[1][4][13]
旗艦檔對旗艦檔,差 8 到 13 倍。 DeepSeek 自家的旗艦 V4 Pro 低峰價是 0.66 / 1.98 美元,對 Opus 4.8 的 5 / 25,輸入差 7.6 倍、輸出差 12.6 倍;快取命中那格 0.022 對 0.50,差 23 倍。[3][12]
差價不是均勻分佈的,它整個壓在旗艦檔上。 這一條把問題徹底改寫了——需要解釋的從來不是「美國的 token 為什麼貴五十倍」,同檔根本沒貴這麼多;真正要解釋的是:為什麼開源那邊連旗艦都賣不出旗艦價?
面對這種價差,市場有一個現成的解釋:中國公司在打價格戰,用虧損換份額,等對手撐不住再說。這個解釋省事,而且過去十年在電商、網約車、共享單車上都驗證過。
它在這裡對不上賬。據 The Information 報道,DeepSeek 今年前七個月的營收約 4.75 億元人民幣(約 6707 萬美元),約為 2025 全年的十倍,而其中 API 業務的毛利率是 82.9%。[6][7][8] 一門賠本賺吆喝的生意,不會在最核心的那格上留下這樣的數字。
錢是省出來的,不是貼出來的。省在三處。
接下來三節先說清楚這個價格的地板是怎麼壓下去的;地板之上剩的那幾倍是另一回事,留到後面再拆。
第一處:320B 的模型,每個字只叫醒 18B
第一處最容易被誤讀——大家判斷模型先認總引數,而總引數幾乎不決定單次呼叫的成本。
MoE(混合專家)的思路是把一個大模型拆成很多小專家,每處理一個 token 只叫醒其中幾個,其餘的躺在視訊記憶體裡不動。DeepSeek 早在 DeepSeek-MoE 上就做過一個 16B 引數、每 token 只啟用 2.7B 的版本,並在標準 MoE 之外加了一個「共享專家」——它永遠在崗,負責通用能力;其餘的「路由專家」按需上工,負責專門活。這樣既緩解了專家忙閒不均,也避免幾個專家學同一件事。
這一代的啟用比壓得更狠:
- GLM-5.3-Flash:總引數 320B,每次啟用 18B,約 5.6%。[1]
- Qwen3.8-Flash-Next:總引數 125B,每 token 啟用 6B,約 4.8%。共 512 個專家,每次叫醒 10 個路由專家外加 1 個始終在崗的共享專家。[2]
- DeepSeek V4 Flash:以極低的引數啟用比壓低推理成本,被視為其價效比優勢的核心。
省掉的是哪一筆?是每個 token 要走的矩陣乘法量。模型每吐一個字,要做的浮點運算大致跟著參與計算的引數走,而不是跟著擺在那裡的引數走。320B 的模型和 18B 的模型,在這一筆賬上是同一個量級。
落到價目表上,這是輸出價能進到一美元以內的第一個前提。也是「模型很大」和「呼叫很便宜」這兩件事能同時成立的原因。
這一處有個天花板:稀疏化省的是算力,不省視訊記憶體——320B 的權重還是得整個裝進機器。真正把長文本的成本咬住的,是下一筆。
第二處:把最貴的那種注意力限量供應
注意力是 Transformer 的核心動作:模型每生成一個字,都要回頭看一遍前面已有的內容,判斷哪些相關。標準做法是每個新字都跟全部舊字比一遍,開銷隨著長度按平方漲——上下文翻十倍,這筆賬翻一百倍。
配套的還有 KV cache,即模型把讀過的內容在視訊記憶體裡存成一份「備忘」,免得每次從頭算。文本越長,這份備忘越佔地方,而視訊記憶體是推理成本里最貴的一塊。
三家的解法不同,方向一致:讓最貴的那種注意力少出場。
DeepSeek 走的是壓縮路線。 V2 時代用多頭潛在注意力(MLA)替代標準多頭注意力,靠低秩近似把潛在向量壓小,直接縮掉 KV cache 的體積。到 V4,改用 Token-wise Compression 配 DeepSeek Sparse Attention(DSA,一種選擇性回看機制,讓模型不必每個 token 都重讀整段上下文),KV cache 可壓縮 4 倍至 128 倍。[9][10] V4 另有約束稀疏注意力(CSA)與重度壓縮注意力(HCA)兩項改進。
Qwen 走的是配比路線,而且把比例寫死在了架構裡。Qwen3.8-Flash-Next 的 48 層中,每 4 層有 3 層走 Gated DeltaNet——線性注意力,開銷隨長度線性漲而非平方漲;只有 1 層走 Qwen Sparse Attention(QSA),在 micro-block 級別挑重點回看。算下來 36 層線性、12 層稀疏。[2] 更值得看的是頭數:QSA 只有 2 個 KV 頭,對著 24 個 Q 頭——KV 頭的數量直接決定那份「備忘」有多厚,而這裡只留了兩份。[2]
智譜走的是混用路線。 GLM-5.3-Flash 直接採用稀疏與線性注意力的混合架構,[1] 而 GLM-5 系列此前已整合過 DeepSeek 的 DSA 技術來壓部署成本。三家還共用了一個不那麼起眼的部件:mHC(Manifold-Constrained Hyper-Connections,一種強化殘差連線、提升擴充套件效率的結構),DeepSeek V4 和 GLM-5.3-Flash 都在用。[1]
Qwen 還有一手更少見的賬:51B 的 n-gram 嵌入引數,放在第 2 層,走 bigram 和 trigram(相鄰兩字、三字的固定組合)。[2] 這 51B 不計入那 6B 啟用引數——因為嵌入表是查出來的,不是算出來的,它不參與每個 token 的矩陣乘法。相當於把「查得到的東西」從算力賬挪進了儲存賬,而儲存比算力便宜得多。
Qwen 這套配比集中在一張表裡:
| 專案 | 數字 |
|---|---|
| 總引數 | 125B |
| 每 token 啟用 | 6B(約 4.8%) |
| n-gram 嵌入引數 | 51B(置於第 2 層,bigram / trigram) |
| 多 token 預測(MTP,一次預測多個字的輔助模組) | 4B |
| 專家配置 | 512 個專家,每次啟用 10 個路由專家 + 1 個共享專家 |
| 注意力配比 | 每 4 層:3 層 Gated DeltaNet(線性)+ 1 層 QSA(稀疏),全模型 36 : 12 |
| QSA 頭數 | 24 個 Q 頭 / 2 個 KV 頭 |
| 原生上下文 | 262,144 token,可用 YaRN 擴充套件至 1,000,000 |
[2]
落到價目表上,這一處買來的是長上下文不再是加價項。GLM-5.3-Flash 的評測裡最長用到 300,000 token,訓練語料是 30T token 的多模態資料,也是 GLM-5 系列首個原生多模態模型。[1] 從前長文件要按天價計,現在跟短對話共用同一欄標價。
第三處:讀過的前文,第二遍幾乎不再收錢
前兩處壓的是算力和視訊記憶體。第三處乾脆把一部分工作整個取消。
一個 Agent 跑三十輪,每一輪都要把之前的對話、工具說明、文件原文重新發給模型;一份合同問十個問題,十次請求裡有九成內容一模一樣。傳統做法是每次從頭預填充一遍——同一段文字被反覆讀,反覆收錢。
快取命中就是伺服器認出「這段字首我算過」,直接調出中間結果接著往下走。價目表上的差距因此驚人:
- DeepSeek V4 Flash 低峰時段,快取命中輸入每百萬 token 收 0.007 美元,未命中收 0.22 美元,相差約 31 倍。[3]
- GLM-5.3-Flash 是 0.03 美元對 0.15 美元,5 倍。[1][4]
命中率是這一處值多少錢的全部關鍵。據實驗資料,DeepSeek V4 即使間隔 12 小時,快取仍保持 100% 命中,這被視為其低價護城河的構成部分。12 小時意味著什麼?昨晚放下的對話,今早接著問,前文那一段依然按 0.007 美元結算。
DeepSeek 還在 2026 年 8 月 16 日 16:00 UTC 起把統一價改成了分時計價:高峰是低峰的兩倍,高峰時段為 UTC 01:00–04:00 與 06:00–10:00。[3] 價格開始跟著機器的忙閒走,這本身就是一句關於成本結構的自白——定價盯的不只是每次呼叫花了多少,還有那批機器有沒有閒著。
三處的總賬:
| 省在哪 | 機制 | 省掉的開銷 | 價目表上的落點 |
|---|---|---|---|
| 引數稀疏化 | MoE,只叫醒一小撮專家 | 每 token 的矩陣乘法量按啟用引數走 | 320B / 125B 級模型的輸出價能進到一美元以內 |
| 注意力 | 稀疏 + 線性混合、KV cache 壓縮 | 長上下文的平方級算力與視訊記憶體佔用 | 二十六萬到三十萬 token 的上下文不再單獨加價 |
| 快取命中 | 重複字首直接複用中間結果 | 整段前文的重複預填充 | 命中 0.007 美元對未命中 0.22 美元 |
對賬:賺錢的是呼叫,虧錢的是產能
三處機制省下的錢,最終要落到一本真賬上才算數。DeepSeek 那本賬少見地被拆到了 API 這一格,數字出自 The Information 引述的匿名信源,公司未予確認。[6][7]
據該報道,2026 年前七個月:營收約 4.75 億元人民幣,約十倍於 2025 全年;API 業務毛利率 82.9%,公司整體毛利率 44.6%;淨虧損約 7.15 億元人民幣,而 2025 全年淨虧 9.35 億元;同期投入 AI 基礎設施約 110 億元人民幣,主要用於租用 AI 晶片伺服器與採購算力裝置,2025 全年這一項只有 12 億元。[6][7][8]
毛利率是賣出一塊錢的服務、扣掉直接成本後剩下多少。API 那一格 82.9%,說明這三處確實把單次呼叫的成本壓到了標價的兩成以內——這一格不但不虧,還厚過許多軟體生意。
整體 44.6% 是另一回事。4.75 億元乘 44.6%,整體毛利約 2.1 億元,離 7.15 億元的虧損差著一整層費用。而同期 110 億元的基建投入,是營收的二十三倍多,是去年同一項的九倍多。
虧的不是呼叫,是產能。 那批機器,絕大部分還沒開始產生營收——有的剛上電,有的還在路上,有的對應的是 DeepSeek 正在內蒙古烏蘭察布籌建的 1GW 級資料中心,據彭博社報道其部分算力預計在 2027 年底或 2028 年初才投運。訓練、研發、折舊擺在賬的另一側,靠 4.75 億元量級的營收去追。
這也正是降價還能繼續的原因。單次呼叫那一格留著的空間還厚,成本曲線還在往下走,產能上來之後固定成本被攤得更薄——每一項都指向同一個方向。一個單點更直白:DeepSeek-V4-Flash-0731 在 ARC-AGI-2 基準下的單任務成本僅 0.042 美元,與 GPT-5.6-Luna-0730 成績相近但成本低 4 倍多,被認為留有較大調價空間。
同一份報道還寫到,DeepSeek 正在推進第二輪融資,目標募資 500 億元人民幣、估值 5000 億元人民幣,並在籌備上海 IPO。[6][7] 一門單次呼叫毛利這麼厚的生意,去募一筆相當於其前七個月營收一百倍的錢——兩個數字放在一起,就是這門生意當下的全部張力:賺錢的部分很賺,要養的部分很大。
三處機制是地板,不是價籤
這三處有一個共同點:全都寫在公開的模型卡和技術報告裡。MoE 的啟用比、注意力的層間配比、KV cache 壓多少倍、快取命中視窗有多長——權重開源,論文可讀,程式碼可跑。GLM-5 整合 DeepSeek 的 DSA,Qwen3.8-Flash-Next 把 DeepSeek-V4-Flash 直接列進對比基準。[2]
公開到這個程度,就意味著閉源那邊不可能沒在用。快取複用那一處是明著的:Anthropic 的快取讀取按基礎輸入價的十分之一計,Batch API 非同步批處理再打五折。[12] MoE 那一處兩家都不公開架構,無從直接核對,但按小杯檔的價位和吞吐倒推,稠密架構幾乎無從成立。至於注意力改造,閉源兩家確實落後一個代際——原因不是沒抄,是這類改動只能在下一次預訓練裡落地,沒法熱更到已經訓好的權重上,外界看到的永遠是一個訓練週期的滯後。
於是問題就變了。一個雙方共有的因素,解釋不了雙方的差異。 三處機制回答的是「推理為什麼可以便宜」,不是「中國為什麼比美國便宜」。
它們決定的是地板在哪。決定誰站在地板上的,是另一件事。
權重公開的那一刻,價格就不歸你定了
GLM-5.3-Flash、Qwen3.8-Flash-Next、DeepSeek——這幾個模型的權重全是公開的。任何人下載下來都能自己託管,OpenRouter 上一個 GLM 同時掛著好幾家供應商。[4]
這件事對價格的後果是決定性的:權重一旦公開,API 價格就成了商品化託管的競爭價。 Z.ai 敢往上加,別家就能用同一份權重把它打下去。價格只能向服務成本收斂,收斂得多快取決於有幾家在託管。
Claude Opus 只有一個賣家。Anthropic 對自己的權重是獨佔的,沒有第二個人能提供同樣的東西,價格因此按價值定,而不按成本定。一個旁證:同一家公司同時賣 25 美元和 5 美元的輸出(Opus 對 Haiku),說明它完全有能力把 token 賣便宜——旗艦的高價是定位選擇,不是成本天花板。
回到那張按檔位拆開的價目表,三行觀察各自對應一句解釋:
| 觀察 | 解釋 |
|---|---|
| 小杯檔雙方基本打平(Luna 0.20 / 1.20 對 GLM-Flash 0.15 / 0.50) | 三處機制是共有的地板,兩邊都站在上面 |
| 閉源有 5 / 25 美元的旗艦檔 | 權重專有、獨家賣方,可以按價值定價 |
| 開源的旗艦隻賣到 0.66 / 1.98 | 權重公開、誰都能託管,價格壓不住 |
還有兩項次要的:真實成本差(電價、自建與雲上租卡、注意力架構落後一個代際)大約兩三倍,是實打實的、不是賬面調整能變出來的;產能配給容易被漏掉——在卡最緊的時候,降價只會讓容量更早耗盡,還會擠掉自家更值錢的用途,訓下一代模型、跑自家的 agent 產品。高價在這裡起的是閘門作用。
但這兩項都不足以撐起旗艦檔那 8 到 13 倍,而且它們在小杯檔上同樣存在——小杯檔卻沒有拉開差距。能同時解釋「小杯打平、旗艦差十倍」的,只有權重開不開源這一條。
這裡還剩一個乍看彆扭的地方:既然開源權重把價格摁回成本,DeepSeek 怎麼還能在那麼低的價上留住 82.9% 的毛利?因為開源設的是天花板、不是地板——你不能比第三方託管貴太多,但在天花板底下,自家的推理棧跟自家架構是共同設計的、快取命中率也最高,那點差距就是留下來的毛利。
賬單上的第四行
前三處已經公開到人人可抄,第四處剛剛開始各走各的——晶片本身。阿里雲自研的真武 M890 已經上線並開始規模化銷售,其超節點例項支援超 2 萬億引數模型的推理,千問自家的旗艦模型就跑在上面。DeepSeek 則秘密推進自研推理晶片約一年,專攻推理而非訓練,已與多家晶片設計公司、晶圓代工廠及儲存廠商接洽。
三處省法是共同的地板,權重開不開源決定誰站在地板上。而第四行才剛拉開差距。