AI基础设施的叙事正在发生关键转折:从单纯的建设扩张转向商业化变现,但资本开支并未见顶。最新数据显示,AI推理的Token成本较5月峰值暴跌37.5%,降至每百万Token 1.33美元;与此同时,英伟达Blackwell GPU的租金却逆势上涨15.2%,达到每小时5.18美元。这种供给侧涨价、消费侧降价的现象,被市场称为推理经济的“剪刀差”阶段,意味着产业重心正从“建多少算力”转向“怎么把算力变成钱”。
花旗分析师Heath Terry在最新AI行业周度跟踪中指出,智能路由是Token降价的核心驱动力。企业不再一律调用最强模型,而是根据任务复杂度自动调度,从而系统性压缩推理开支。这一变化反映了企业AI应用的成熟:它们开始精打细算,用更经济的模型处理简单任务,只在必要时调用顶级模型。
然而,供给侧的景象截然不同。二季度超大规模厂商的AI资本开支回报率达到28%,几乎是融资成本(约6%)的五倍。高回报刺激下,即便美国两党本周罕见地联合推动数据中心建设禁令,谷歌和SpaceX仍在财报季后加速基础设施扩张,亚马逊更是追加了200亿美元资本开支。值得注意的是,这笔追加投资主要受存储成本上涨驱动,多家公司都提到了这一因素。AWS的合同需求已排到2028年,管理层预计产能紧张将持续到2027年。
电力、许可和劳动力三重约束,正将原本预期三年完成的产能扩张拉长到五至十年。德克萨斯州的全州审计冻住了超过1800个项目、474GW的审批队列,其中数据中心占新增电力申请的约90%。电力正在取代芯片,成为AI基建最紧迫的瓶颈。核心建设方给出的口径是新投资一年回本,因此谁能更早锁定供电时间,谁的站点溢价就越高,收入兑现也越快。对供应商而言,稀缺基础设施的高定价可以维持更久,但部分收入将被推迟到更晚的周期。
推理负载的“变重”也在加剧存储和互连的紧张。过去三周,每个推理任务的平均输出Token数上升11%至2.4万个,推理密集型任务尾部涨9%至4万个。输出Token占比升至41%,缓存活动降至57%,输入Token稳定在2%。模型每次调用消耗的计算资源在增多,没有架构层面的突破,以输出和缓存为主的工作负载将持续推高对HBM和互连芯片的需求,这也是亚马逊追加资本开支的底层原因之一。
模型竞争层面,开源与闭源的全球智能差距已收窄至仅4分,但拉近差距的主要是中国厂商。根据Artificial Analysis智能指数,领先闭源模型Anthropic Claude Opus 5得分61,领先开源模型月之暗面Kimi K3得分57,差距从此前的9分收窄至4分。然而,美国领先闭源与美国领先开源之间的差距仍有21分。开源模型被豁免于发布前安全测试,短期可能加速追赶,但中美开源的实力不对称才是更深层的格局变量。
推理速度的优化远快于智能提升:Top 20厂商中位推理速度回升至118 Token/秒,周环比涨55.3%,而中位智能得分稳在43分。行业重心已从“更聪明”转向“更快”。定价分化也极为剧烈:美欧混合Token均价1.63美元/百万Token,中国仅0.80美元,不到前者一半。DeepSeek V4 Flash和小米MiMo-V2.5-Pro标价0.03美元/百万Token,几乎零成本。前沿模型均价1.30美元,周环比降3%。
密集的新模型发布窗口即将打开:未来半年,DeepSeek排了V4.1和V4.2,谷歌排了Gemini 3.5 Pro到4.2四个版本,SpaceX排了Grok 4.6到5.1四代。新一波前沿模型可能重新拉开差距,但追赶者的出牌节奏同样在加快。
安全治理正从合规议题演变为商业凭证。AISI在122次模型评估中记录了19次未经授权的实时互联网活动,能力越强,失控风险越真实。长远看,政府安全审查可能成为前沿闭源厂商的竞争壁垒。AI驱动的网络攻击日趋频繁和复杂,“经过政府认证”本身就是面向受监管企业客户的商业资质。
前沿能力的天花板还很远。OpenAI披露一个未发布模型用2000美元API成本生成了10项数学突破,能力上限远未触及,但调用门槛在快速降低。开发者加速入场,多提供商SDK下载量周环比增长12.7%。应用端,通义千问周活增长2.5%,Gemini增长0.5%,Kimi下降0.8%,流量格局仍在快速变化。
就业市场方面,7月AI驱动裁员录得3220人,较前月21640人下降85%。但裁员数据波动性极大,AI驱动裁员在总裁员中的占比并未趋势性下降。下一轮宏观调整来临时,AI替代的加速效应仍可能再次放大。
整体来看,AI产业的钱没少花,但花法在变。资本开支依然强劲,但变现路径已经打开,推理经济的剪刀差正在重塑产业链的价值分配。