DeepSeek 近期宣佈漲價,幅度高達 30 倍,但第三方平台 OpenCode 工程師 dax 在帖子中表示,即便租賃 GPU 也能復現其當前價格,並推測這次漲價並非因為虧損,而更像是一種流量調控手段——當前服務負載過高,希望通過提價壓低需求、緩解過載。這一觀點與不少網友的感受一致,有使用者在知乎上評論稱,V4 Flash 價效比過高導致全球使用者持續湧入,伺服器不堪重負,大模型領域“高智、低價、服務穩定”目前仍是“不可能三角”。

值得注意的是,第三方平台的價格甚至可能比 DeepSeek 官方更低。根據 OpenRouter 的資料,DeepInfra 對 DeepSeek V4 Flash 0423 的輸入和輸出價格分別為每百萬 Token 0.09 美元和 0.18 美元,而官方對應價格為 0.14 美元和 0.28 美元,按標價計算,DeepInfra 便宜約 36%。GMICloud、百度千帆等平台報價也低於官方。這得益於 DeepSeek 已公開 V4-Flash 權重,許可證允許第三方使用、修改、再分發甚至商業銷售,因此第三方可以下載權重自行生產 Token,而非像閉源模型那樣必須向官方購買 API。

然而,價格更低並不意味著使用者實際花費更少。以 OpenCode Go 為例,其訂閱服務首月 5 美元、之後每月 10 美元,官方宣稱通過批次採購和預留 GPU 容量,使用者可獲得最高約 6 倍的使用價值。但一名開發者用真實 AI Coding 任務測試發現,在短任務中 OpenCode Go 的消費金額平均約為官方 API 的 4 倍,部分長會話差距超過 10 倍。該開發者指出,主要差異在於快取命中率——DeepSeek 官方 API 的快取處理明顯優於 OpenCode Go,會話越長,快取未命中越多,成本放大越明顯。他建議,短任務用 OpenCode Go 尚可,但長會話(累計執行超約 5 分鐘)直接呼叫官方 API 更划算。

快取命中率正是 DeepSeek 低價護城河的關鍵。知乎答主“蘇遲但到”進行了 3 天、兩萬次實驗,測試多家模型的快取存活時間,結果顯示 DeepSeek 表現最突出,無論何時命中率始終 100%,即使間隔 12 小時也不失效;MiniMax 次之,非工作時間約 90%;GLM 最弱,5 分鐘僅剩 25%。DeepSeek 官方快取價格低至 0.0028 美元,若命中率高達 95% 以上,輸入 Token 成本幾乎可忽略。其架構設計功不可沒:V4 採用 Token-wise Compression 和 DeepSeek Sparse Attention(DSA),據 vLLM 團隊拆解,KV Cache 可壓縮 4 倍至 128 倍,在百萬 Token 上下文下,BF16 快取佔用約 9.62 GiB,比 V3.2 縮小約 8.7 倍,實際部署用 FP4/FP8 還能再降一半。

不過,第三方與官方在模型能力上也可能存在差異。有開發者測試發現,經 OpenCode 路由的 V4 Flash 上下文視窗僅約 600k,超過後會被壓縮截斷,而官方支援全量 1M 上下文,因此能力更全面。更重要的是,同一模型在不同工具中的表現差異明顯:在 Codex 中,V4 Flash 可與 Fable 5 打平,但在 OpenCode 中只能發揮約一半水平,主要體現在對問題的整體理解和長程任務記憶連貫性上。DeepSeek 官方釋出的 Codex 接入文件提供了詳細配置,包括並行工具呼叫、約 104 萬 Token 上下文、95% 有效視窗等,這暗示 Harness 適配(訊息路由、記憶管理、工具呼叫等)對模型實際效果影響巨大,甚至可能比模型智力本身更重要。

dax 還透露,OpenCode 正推動通過 OpenCode Go 在中國以外地區提供低價 DeepSeek 服務,但復現低價並非其團隊獨立完成,而是與另一支合作團隊共同實現。這一訊息若屬實,將重新審視 DeepSeek 基礎設施團隊的“傳奇”地位。不過,第三方與官方在快取命中率上的差距,以及 Harness 適配的複雜性,意味著“低價”並不總是等於“低成本”,開發者在選擇時需結合具體使用場景權衡。