过去两年,大语言模型 API 市场的主要竞争手段是不断降低每百万 token 的价格,以此吸引开发者、扩大使用份额,并让自家模型成为应用内的默认选择。然而,这一阶段正逐渐让位于更多样化的定价工具:分时段费率、缓存感知折扣、模型分层,以及少数与业务成果挂钩的收费尝试。
8 月 17 日,DeepSeek 的新价格方案正式生效,引入了高峰和低谷时段:在北京时间 9:00-12:00 和 14:00-18:00 的白天高峰时段,费率较高;其他时间则减半。以 V4 Pro 模型为例,高峰时段缓存未命中时输入价格为每百万 token 9 元,输出价格为 27 元,缓存命中时输入价格为 0.3 元;低谷时段价格均为高峰的一半。而就在几天前,该模型公布的早期价格还是缓存未命中输入 3 元、输出 6 元、缓存命中输入低至 0.025 元。因此,涨幅最大的是高峰时段的缓存命中输入价格。类似的调整也适用于更轻量的 V4 Flash 模型,其高峰价格分别为 3 元、9 元和 0.1 元。
这些具体数字本身并不重要,重要的是它们所引入的定价结构。分时段定价将非紧急工作负载引导至空闲时段,从而提高固定服务容量的利用率。缓存感知定价奖励那些复用上下文而非重新处理的系统。旗舰模型与轻量模型分开定价,让高容量、简单任务以较低成本运行,而复杂推理仍可收取溢价。
中国和海外的其他供应商也在测试类似的方法,包括预付费套餐、基础费加使用费组合,以及少数将费用与可衡量结果挂钩的商业协议。
推动这一变化的力量来自多个方面。一旦模型嵌入智能体工作流,token 使用量会急剧上升。单个用户请求可能触发长链的中间步骤、工具调用和修订。服务这些链条需要持续的算力、内存带宽和能源投入,单个 token 的边际成本不再微不足道。
与此同时,领先开源模型与专有模型之间的性能差距已经缩小。全球使用量追踪显示,中国模型在公开 API 流量中占据更大份额。当相似质量的替代品以不同价格出现时,标价和总拥有成本对许多买家来说就变得至关重要。海外高价供应商则通过选择性降低某些模型和层级的费率来应对。
因此,整个市场的价格呈现双向变动:曾经主要靠成本竞争的供应商在提价,而试图保住市场份额的现有厂商在降价。此前全面超低价的阶段正在结束,取而代之的是更精准地将价格与实际需求和成本模式相匹配。
企业客户也面临内部变化。传统软件预算往往偏好固定许可或席位数量,即资本支出或可预测的运营支出,以适应年度规划周期。而 token 计费引入了难以预测、难以跨团队分配的可变成本。一些组织因此倾向于私有化或混合部署,以恢复一定程度的成本控制;另一些则接受按使用量计费,但要求更清晰的监控、警报和成本分摊工具。少数企业正在尝试与结果挂钩的协议,如按节省的小时数、解决的案例数或避免的损失收费,但这些仍难以标准化,因为结果高度依赖于模型的提示方式、集成方式和监督方式,同一系统在不同使用者手中可能产生截然不同的经济价值。
供应商也在相应调整产品线。轻量或 flash 模型处理常规、高容量的任务,旗舰模型则保留给更难的推理问题。缓存折扣和高峰定价改善了服务的经济性。少数公司正在探索收入分成或商业许可结构,将对话从纯 token 数量转向客户实际提取的经济价值。
共同的主线是试图超越每百万 token 的纯商品化竞争。核心商业问题因此改变:不再是谁标价最低,而是某个模型在给定价格、延迟和可靠性水平下,能否产生足够的可衡量价值,以证明其在客户 AI 预算中的位置。DeepSeek 转向高峰定价和更高的绝对价格,正是该供应商试图更精确回答这一问题的举措。
整个行业都面临同样的压力。随着智能体使用增长,持续推理的真实成本越来越难以忽视,定价不再是为了赢得规模,而是为了将成本结构与真实的需求和支付意愿对齐。这一转变不会整齐划一。一些工作负载仍将高度价格敏感,继续追逐最低费率;另一些,尤其是嵌入关键业务流程的,将接受更高价格以换取可靠性、支持和可预测的性能。正在形成的市场是多种价格点和多种商业模式共存,这看起来更像其他基础设施市场中早已熟悉的差异化定价,而非过去两年的纯粹折扣。