一百万个 token——模型读写文字的最小计费单位,一个汉字大约合一到两个——在 5 月还能卖 2.05 美元。到 8 月底,同样一百万个,整个市场收上来的钱是 0.97 美元。这条线有记录以来第一次跌到 1 美元以下。
0.97 不是任何一家的报价,是全市场按实际用量加权出来的平均数。它跌下去由三股方向相反的力合成:厂商真的降了价、需求跑向了更便宜的档位、单位生产成本自己在塌——三股里只有第一股是收入被砍。这门生意的成色如何,判据从来不是均价,而是量能不能把价补回来。8 月的账,补得极薄。
这个 0.97 到底在量什么
指数全名 Silicon Data LLM Token Expenditure Index,代号 SDLLMTK,每日发布,口径写得很直白:衡量市场每使用一百万 token 的加权均价。 加权的意思是,谁用得多谁的权重大——一个几乎无人调用的顶配模型,标价再高也拉不动这条线;一个被海量调用的廉价档降一次价,整条线立刻往下沉。发行方在方法论里把这件事说成「按每一段市场被消费的样子给它定价,而不是按目录上标的价」。
所以它是一个混合读数:既反映价,也反映量的结构。把它当成 AI 商业化的体温计,第一步就走错了方向。
三股力这个说法不是外人的归纳,是指数发行方自己写在方法论里的。它列出这条线会动的三个原因:供应商改了定价、用量在更贵与更便宜的模型之间转移、被计入的模型组成本身变了。 高盛在 9 月初那份报告里的措辞与之吻合,也同样克制:指数下跌可能是标价下调,可能是用户迁往低成本的开源模型,也可能两者兼有;但这并不意味着 AI 的使用量在萎缩。同一份报告里还有一句更硬的提醒——更多需求配上更低价格,如果价格跌得比用量涨得快,并不自动构成利好。
三股力,含义正好相反:
| 哪股力 | 8 月能拿出的实例 | 谁的收入真受损 | 对毛利的含义 |
|---|---|---|---|
| ① 同款降价 | Luna 输入 1→0.2、输出 6→1.2 美元;Sol 输入 5→4、输出 30→20 美元 | 闭源厂自己,同一次调用少收钱 | 成本若没同步降,毛利变窄 |
| ② 需求迁移到便宜档与开源 | 某中转平台开源份额 60 天从 28% 到 62%;智谱「牛来」测试期日处理 100 万亿 token | 没有人的钱被砍——那部分收入本来就不在这本账上 | 与毛利无关,是统计口径的位移 |
| ③ 单位生产成本崩塌 | Blackwell Ultra 半年内每 token 成本降 60%;Luna 运行成本降约 80% | 无 | 价随成本降,毛利可能不变甚至变宽 |
第一股力:标价是真砍了
OpenAI 在 7 月 30 日把 GPT-5.6 Luna 的价格削掉八成——输入从每百万 token 1 美元降到 0.2 美元,输出从 6 美元降到 1.2 美元。 财联社在报道里点明了动机:应对中国低价模型的竞争。
三周之后的 8 月 21 日,刀落到了旗舰 Sol 身上:输入从 5 美元降到 4 美元,输出从 30 美元降到 20 美元——输出那一刀砍掉了三分之一。
这一股是实打实的减收。同样一次调用,账单短了一截。它也是三股力里唯一一股配得上「价格战」三个字的。
它只占三分之一。
第二股力:钱不是被砍了,是流出了这本账
Vercel 的 AI Gateway(开发者用来调用各家模型的中转平台)披露过一组数据:过去 60 天里,开源模型占它 token 调用量的份额从 28% 涨到 62%,历史上第一次反超闭源。 开源模型指的是把参数公开、任何人可以下载到自己机器上跑的那一类——用它不必按次向原厂付钱,只付自己那点电费和折旧。
这些 token 照样计进「全市场用了多少」,却几乎不计进「全市场付了多少」。均价被它们往下压,而被压掉的那部分钱,从头到尾没有出现在任何一家闭源厂的收入表上。
最极端的例子在中国。智谱确认,新模型「牛来」在测试期间每天处理 100 万亿 token,全部跑在十万张以上的国产芯片上。 一天 100 万亿,折成「百万 token」这个计价单位是一亿个;按 8 月那个 0.97 美元的均价折算,市价约合 9700 万美元。这笔钱一分没进任何一家按 token 收费的公司账上——它甚至不构成谁的损失,因为它本来就不在那本账里。
均价被拉低了。收入表纹丝没动。
第三股力:价在降,成本降得更快
这一股最容易被均价盖住,也最该被看见。
英伟达 8 月发布 Blackwell Ultra 时给出的对比是:与半年前相比,每 token 成本降低 60%,吞吐提升 2.7 倍。 再下一代的机柜 Vera Rubin NVL72 更陡:官方给出的对比是,相比上一代 GB200 NVL72,同样一兆瓦电力能产出的 token 数量提高到 10 倍,每百万 token 的生产成本降到十分之一。 这些都是厂商自己测的数、取的是最有利的那类负载,不是普遍值。
这是硬本事,不是财技。半年一代的迭代节奏把同一件事的电费和折旧一级一级往下压,压出来的空间才是降价的底气。
软件那一侧的改善同样陡。OpenAI 披露,自家模型参与优化推理架构之后,Luna 的运行成本下降约八成,公司把这称作递归自我改进的早期形态。 把这个八成,和 7 月 30 日那次八成的降价并排放——降本的幅度和降价的幅度,落在同一个数量级上。
价随成本降,毛利可以纹丝不动。这一股力把均价拉下来的时候,没有谁的钱被拿走。
把 8 月这本账算一遍
模型调用中转平台 OpenRouter 在 8 月给出的两个环比数字是:token 用量涨 47%,美元支出涨 7%。
这两个数可以当场算平:
| 项目 | 8 月环比 |
|---|---|
| token 用量 | +47% |
| 美元支出 | +7% |
| 隐含的加权均价(1.07 ÷ 1.47) | 约 −27% |
| SDLLMTK 独立测出的均价变化 | −29% |
| 支出打平所需的用量增长 | 约 +37% |
1.07 除以 1.47 等于 0.728,隐含的均价环比跌了约 27%。SDLLMTK 用完全另一套口径独立测出的是 29%。两个来源、两条路径,落在同一个位置——这不是某一家平台的偶然,是整个市场的读数。
打平线在 +37%:均价跌 27% 时,用量涨到 1.37 倍,支出就能持平。8 月的用量涨了 47%,超出打平线 10 个百分点,落到钱上就是那 7%。
四十七换七。收入没有掉,掉的是这条计价线的杠杆——用量每多涨一个百分点,只能换回约 0.15 个百分点的钱。
卖铲的在涨价,卖 token 的在降价
8 月初有两个读数并排摆着:Blackwell GPU 的租金逆势上涨 15.2%,到每小时 5.18 美元;同期 AI 推理——模型对外回答问题时的实际运算,区别于事先把模型练出来的训练——每个 token 的成本较 5 月峰值跌了 37.5%。华尔街见闻把这个组合称作推理经济的剪刀差。 到 8 月底,加权均价相对 5 月高点的跌幅已经超过一半。 两个读数是同一条趋势线上的两个时点,彼此印证。
英伟达那一头不缺买家。公司称需求满足率约七成;季报的「未来承诺」表里,「供应与产能」一行合计 2790 亿美元。 官方措辞把这笔钱说明为用于数据中心基础设施系统、主要是内存与制造产能——不是某一种芯片的采购锁单。
被两头夹住的,是夹在中间「租 GPU、卖 token」的那些公司。上游的租金在涨,下游的售价在跌,价差由谁承担,账面上看得见。
这条链上的四个位置:
- 上游卖铲:Blackwell 租金 8 月初上涨 15.2%,至每小时 5.18 美元
- 下游卖 token:推理成本较 5 月峰值跌 37.5%;到 8 月底加权均价较 5 月高点跌超一半
- 中间转手层:CoreWeave 二季度自由现金流为负 57.43 亿美元,积压订单约 1040 亿美元
- 出钱的那头:五家超大规模云厂 2026 年资本开支合计约 7370 亿美元,约占其收入 38%
自由现金流指的是经营赚来的现金减掉资本开支之后剩下的钱;负数意味着这段时间是净往外掏钱。手上握着 1040 亿美元订单、同一个季度往外净掏 57.43 亿——这两个数字能同时成立,靠的是对未来 token 单价的一条假设。
7370 亿美元,是按哪条假设签的
那 7370 亿美元的资本开支约占五家云厂收入的 38%,反推回去,这五家今年的收入合计约 1.94 万亿美元。
OpenAI 把到 2030 年的算力基础设施投入抬到约 7500 亿美元,比 2026 年早些时候的估计高出四分之一——原估约 6000 亿;同时公司仍然说产能「紧得厉害」,需求远远大过供给。
甲骨文的账把这种签法的形状显影得最清楚。剩余履约义务 6380 亿美元——这是客户已经签了合同、公司还没交付、还没确认成收入的那部分订单,同比增长 363%,一年前这个数只有约 1380 亿。其中 750 亿与预付或客户自备 GPU 的安排相关。同期资本开支 556.6 亿美元,自由现金流为负 236.9 亿美元,总负债 2187 亿美元,下一财年的资本开支指引约 700 亿。
订单在表的一侧堆到 6380 亿,现金在表的另一侧一年流出 236.9 亿。隔在这两个数字中间的,正是「一百万 token 将来能卖多少钱」这一条假设。
债市已经在给这条假设标价:2026 年发行的 AI 相关债券共 91 只,到 8 月底有 78 只跌破发行价——十只里有八只多。
尺子本身在缩水
行业自己已经在换计价单位了。
OpenAI 在 9 月的 TMT 大会上表示,定价会从订阅、按用量,逐步转向按成果收费——不按用了多少 token 结账,按有没有把一件事做完结账;同一场里给出的卖点是,同等结果下,它的模型所需输出 token 比竞品少 68%。 格隆汇在 GPT-6 Astra 的报道里指向同一个方向:定价可能从 token 单价转向按任务成本衡量。
把这两句拼在一起,会读出一个别扭的形状:一家靠卖 token 收钱的公司,正在把「同一件事少用 68% 的 token」当成竞争力去宣传。模型效率每提高一分,按 token 计价的收入就自己少一分。
需求这一侧并没有软下来。同一场会上,OpenAI 披露前 10% 的前沿企业客户 token 用量已达普通客户的 8 倍,公司内部的使用强度更高到 33 倍。 要的东西越来越多,量的东西越来越不准。
0.97 这个读数真正说出口的,不是「AI 卖不上价」。它说的是:这把用了三年的尺子,正在被三只手同时往下推,其中两只手推的根本不是价格。当用量能涨 47% 而钱只涨 7%,当行业里最大的那家公司开始把「少用 token」写进宣传语,尺子量出来的东西就越来越不像它标着的那个东西。
跌破 1 美元不是价格战留下的伤口,是计价单位失效的第一个读数。下一个单位该怎么定,眼下还没有一个被普遍接受的答案。