8 月 17 日,DeepSeek 调整了 V4 Pro API 的定价,其中缓存命中价格在空闲时段上涨 5 倍,高峰时段更是上涨 11 倍,从每百万 Token 0.025 元涨至 0.3 元。这是 DeepSeek 首次对缓存命中按时间段差异化收费,也标志着这家以低价著称的模型厂商开始对存储资源征收“存储税”。
缓存命中是大模型推理中的一项关键优化。当用户多次请求相同或相似的长文本前缀时,系统可以复用之前计算好的状态,避免重复计算。DeepSeek 凭借 KV 压缩技术和冷热记忆分层架构,将缓存命中率做到极高,从而大幅降低长上下文调用的成本,也因此成为众多代码助手、知识库 Agent 和长文档分析产品的性价比之选。
然而,随着长上下文需求爆发式增长,后端服务器在高峰期面临严重的缓存颠簸。当海量百万 Token 级请求同时涌入,GPU 显存被迅速占满,调度系统不得不将部分缓存块从显存驱逐到 NVMe 磁盘,导致数据在显存与磁盘间频繁搬运,消耗大量 IO 资源和调度算力,甚至可能使集群有效处理能力下降。DeepSeek 的涨价正是为了覆盖这部分新增的存储、调度和搬运成本。
事实上,大模型的成本结构正在发生历史性变化。算力(FLOPs)成本日益降低,而“状态”的保存、带宽和数据搬运成本却越来越昂贵。DeepSeek 的混合压缩技术(CSA 与 HCA)能将 100 万 Token 的 KV 记忆状态压缩至约 10GB,硬件分摊成本极低,但面对指数级增长的长上下文请求,物理资源上限依然构成瓶颈。
其他厂商也面临类似挑战。Anthropic 采用显式缓存断点机制,并对首次写入缓存收取 1.25 倍或 2 倍的溢价,以引导开发者优化缓存策略;OpenAI 则凭借较高的基础定价配置更充裕的显存来缓解缓存压力。相比之下,DeepSeek 因价格过低而不得不直接提价。
尽管涨价,DeepSeek 依然是全球性价比最高的模型之一,其成本远低于 Claude 等竞品。对于已在 DeepSeek 缓存层形成稳定高命中池的开发者而言,更换厂商并不划算,更实际的做法是优化自身的缓存命中率。DeepSeek 的缓存要求前缀完全匹配,任何字符变动都会导致缓存失效。开发者需注意将动态内容(如时间戳、用户 ID)放在 Prompt 末尾,避免在上下文中间插入工具结果,并统一文本格式,以最大化缓存复用。
这波涨价也促使开发者角色转变——从单纯调用 API 转向管理数据缓存。推理系统底层已演变为分布式存储系统,开发者需要学会区分热数据和冷数据,合理规划缓存生命周期,以在高峰期避免缓存被驱逐。大模型应用正进入精耕细作阶段,缓存命中率将成为一道重要的分水岭。