AI的“机器智能”价格在持续下降,但生产它的物理系统的账单却在不断攀升。对供应商定价和能力基准的分析显示,自2022年底以来,达到GPT-3.5或早期GPT-4水平性能的成本已下降数十至数百倍,在某些追踪序列中,固定能力门槛的降幅甚至超过280倍。如今,提供类似结果的通用模型,每百万token的成本往往低于1美元,中端产品的降价幅度在20%至80%之间已成为常态。
与此同时,最大的云和科技公司却一再上调资本开支预测。头部供应商2026年的合计支出预计在7000亿至8000亿美元以上,且还有进一步上调的可能。这些资金正涌入数据中心建设、先进处理器、高带宽内存、网络设备、电力基础设施和冷却系统。
这两大趋势其实相互关联。当某能力的单位成本下降,经济上可行的使用量就会扩大。这正是19世纪经济学家威廉·斯坦利·杰文斯在更高效蒸汽机与煤炭总消耗上升案例中首次指出的模式。如今,更低的推理成本使得持续、多步骤的系统变得切实可行。这些智能体架构不再止步于单一回答,而是会规划、调用外部工具、检查中间结果、纠正错误并迭代。
来自聚合平台的使用数据显示,智能体驱动的token消耗量增长速度远超人类发起的流量,且在最近的测量中已超过后者。完成一项任务,智能体方式所需的token量可能是简单聊天的5到30倍,某些配置下倍数更高。研究估计,到本十年末,智能体活动可能使整体token吞吐量成倍增长。因此,单位价格的下降并未减少对智能生成资源的总需求,反而增加了需求。
瓶颈已沿供应链移动。早期短缺集中在高端处理器,随后转向高带宽内存和将逻辑芯片与内存堆栈集成的先进封装技术。封装产能已扩大数倍,但仍被大量预订;高带宽内存的产出已基本锁定至2026年及以后。在多个地区,电力供应和电网接入成为限制因素,冷却系统也随着机架密度上升而转向液冷方案。
价值往往沉淀在供给扩张最慢的地方。通用模型智能本身已变得更具竞争性和价格敏感,而那些难以快速复制的回报,出现在无法仅靠软件加速生产的物理资产中,或出现在将廉价认知转化为可靠商业成果的运营系统中——包括随每次行动改进的反馈循环、持续的客户关系,以及维持长流程准确性的流程。无差异化的模型接入或简单的中间层则处于两极之间。
随着基础能力变得更便宜、更普及,仅靠连接性收取长期溢价的能力在萎缩。买家越来越以具体的成本削减或产出增益来衡量系统。此前的技术转型也遵循类似路径:一旦稀缺的人类能力变得充裕且廉价,稀缺性并未消失,而是转移了。机器认知正朝这个方向演进,无法以同样速度扩展的环节,正是经济回报集中的地方。这些点的持久性将取决于供给响应的速度,以及扩展的认知能力在多大程度上转化为能证明物理投资合理性的成果。