DeepSeek 近期宣布涨价,幅度高达 30 倍,但第三方平台 OpenCode 工程师 dax 在帖子中表示,即便租赁 GPU 也能复现其当前价格,并推测这次涨价并非因为亏损,而更像是一种流量调控手段——当前服务负载过高,希望通过提价压低需求、缓解过载。这一观点与不少网友的感受一致,有用户在知乎上评论称,V4 Flash 性价比过高导致全球用户持续涌入,服务器不堪重负,大模型领域“高智、低价、服务稳定”目前仍是“不可能三角”。

值得注意的是,第三方平台的价格甚至可能比 DeepSeek 官方更低。根据 OpenRouter 的数据,DeepInfra 对 DeepSeek V4 Flash 0423 的输入和输出价格分别为每百万 Token 0.09 美元和 0.18 美元,而官方对应价格为 0.14 美元和 0.28 美元,按标价计算,DeepInfra 便宜约 36%。GMICloud、百度千帆等平台报价也低于官方。这得益于 DeepSeek 已公开 V4-Flash 权重,许可证允许第三方使用、修改、再分发甚至商业销售,因此第三方可以下载权重自行生产 Token,而非像闭源模型那样必须向官方购买 API。

然而,价格更低并不意味着用户实际花费更少。以 OpenCode Go 为例,其订阅服务首月 5 美元、之后每月 10 美元,官方宣称通过批量采购和预留 GPU 容量,用户可获得最高约 6 倍的使用价值。但一名开发者用真实 AI Coding 任务测试发现,在短任务中 OpenCode Go 的消费金额平均约为官方 API 的 4 倍,部分长会话差距超过 10 倍。该开发者指出,主要差异在于缓存命中率——DeepSeek 官方 API 的缓存处理明显优于 OpenCode Go,会话越长,缓存未命中越多,成本放大越明显。他建议,短任务用 OpenCode Go 尚可,但长会话(累计运行超约 5 分钟)直接调用官方 API 更划算。

缓存命中率正是 DeepSeek 低价护城河的关键。知乎答主“苏迟但到”进行了 3 天、两万次实验,测试多家模型的缓存存活时间,结果显示 DeepSeek 表现最突出,无论何时命中率始终 100%,即使间隔 12 小时也不失效;MiniMax 次之,非工作时间约 90%;GLM 最弱,5 分钟仅剩 25%。DeepSeek 官方缓存价格低至 0.0028 美元,若命中率高达 95% 以上,输入 Token 成本几乎可忽略。其架构设计功不可没:V4 采用 Token-wise Compression 和 DeepSeek Sparse Attention(DSA),据 vLLM 团队拆解,KV Cache 可压缩 4 倍至 128 倍,在百万 Token 上下文下,BF16 缓存占用约 9.62 GiB,比 V3.2 缩小约 8.7 倍,实际部署用 FP4/FP8 还能再降一半。

不过,第三方与官方在模型能力上也可能存在差异。有开发者测试发现,经 OpenCode 路由的 V4 Flash 上下文窗口仅约 600k,超过后会被压缩截断,而官方支持全量 1M 上下文,因此能力更全面。更重要的是,同一模型在不同工具中的表现差异明显:在 Codex 中,V4 Flash 可与 Fable 5 打平,但在 OpenCode 中只能发挥约一半水平,主要体现在对问题的整体理解和长程任务记忆连贯性上。DeepSeek 官方发布的 Codex 接入文档提供了详细配置,包括并行工具调用、约 104 万 Token 上下文、95% 有效窗口等,这暗示 Harness 适配(消息路由、记忆管理、工具调用等)对模型实际效果影响巨大,甚至可能比模型智力本身更重要。

dax 还透露,OpenCode 正推动通过 OpenCode Go 在中国以外地区提供低价 DeepSeek 服务,但复现低价并非其团队独立完成,而是与另一支合作团队共同实现。这一消息若属实,将重新审视 DeepSeek 基础设施团队的“传奇”地位。不过,第三方与官方在缓存命中率上的差距,以及 Harness 适配的复杂性,意味着“低价”并不总是等于“低成本”,开发者在选择时需结合具体使用场景权衡。