8 月 17 日,DeepSeek 調整了 V4 Pro API 的定價,其中快取命中價格在空閒時段上漲 5 倍,高峰時段更是上漲 11 倍,從每百萬 Token 0.025 元漲至 0.3 元。這是 DeepSeek 首次對快取命中按時間段差異化收費,也標誌著這家以低價著稱的模型廠商開始對儲存資源徵收“儲存稅”。

快取命中是大模型推理中的一項關鍵最佳化。當用戶多次請求相同或相似的長文本字首時,系統可以複用之前計算好的狀態,避免重複計算。DeepSeek 憑藉 KV 壓縮技術和冷熱記憶分層架構,將快取命中率做到極高,從而大幅降低長上下文呼叫的成本,也因此成為眾多程式碼助手、知識庫 Agent 和長文件分析產品的價效比之選。

然而,隨著長上下文需求爆發式增長,後端伺服器在高峰期面臨嚴重的快取顛簸。當海量百萬 Token 級請求同時湧入,GPU 視訊記憶體被迅速佔滿,排程系統不得不將部分快取塊從視訊記憶體驅逐到 NVMe 磁碟,導致資料在視訊記憶體與磁碟間頻繁搬運,消耗大量 IO 資源和排程算力,甚至可能使叢集有效處理能力下降。DeepSeek 的漲價正是為了覆蓋這部分新增的儲存、排程和搬運成本。

事實上,大模型的成本結構正在發生歷史性變化。算力(FLOPs)成本日益降低,而“狀態”的儲存、頻寬和資料搬運成本卻越來越昂貴。DeepSeek 的混合壓縮技術(CSA 與 HCA)能將 100 萬 Token 的 KV 記憶狀態壓縮至約 10GB,硬體分攤成本極低,但面對指數級增長的長上下文請求,物理資源上限依然構成瓶頸。

其他廠商也面臨類似挑戰。Anthropic 採用顯式快取斷點機制,並對首次寫入快取收取 1.25 倍或 2 倍的溢價,以引導開發者最佳化快取策略;OpenAI 則憑藉較高的基礎定價配置更充裕的視訊記憶體來緩解快取壓力。相比之下,DeepSeek 因價格過低而不得不直接提價。

儘管漲價,DeepSeek 依然是全球價效比最高的模型之一,其成本遠低於 Claude 等競品。對於已在 DeepSeek 快取層形成穩定高命中池的開發者而言,更換廠商並不划算,更實際的做法是最佳化自身的快取命中率。DeepSeek 的快取要求字首完全匹配,任何字元變動都會導致快取失效。開發者需注意將動態內容(如時間戳、使用者 ID)放在 Prompt 末尾,避免在上下文中間插入工具結果,並統一文本格式,以最大化快取複用。

這波漲價也促使開發者角色轉變——從單純呼叫 API 轉向管理資料快取。推理系統底層已演變為分散式儲存系統,開發者需要學會區分熱資料和冷資料,合理規劃快取生命週期,以在高峰期避免快取被驅逐。大模型應用正進入精耕細作階段,快取命中率將成為一道重要的分水嶺。