月之暗面(Moonshot AI)于 7 月 17 日发布其最新大模型 Kimi K3,一度被视为中国开发者能以更低成本逼近 AI 前沿的又一例证。然而上线仅数日,激增的用户需求便使其 GPU 集群接近容量上限,迫使公司暂停新消费者订阅。这一幕与 2025 年初 DeepSeek V3 因病毒式传播遭遇算力瓶颈的情形如出一辙。
这一事件再次向投资者揭示了 AI 经济中的结构性分裂:模型层面的竞争正使产品难以维持高溢价,但 算力本身依然稀缺。分析认为,英伟达(NVIDIA) 与 微软(Microsoft) 在这种格局下可能比那些烧钱追逐模型前沿的实验室处于更有利的位置。
Kimi K3 的成本优势并不如宣传中显著
K3 的 API 定价为每百万输入 token 3 美元、每百万输出 token 15 美元。但据 Artificial Analysis 估算,其在 Intelligence Index 任务上的平均成本为每项 0.94 美元,而 OpenAI 的 GPT-5.6 Terra(最大推理力度)为 0.55 美元,GPT-5.6 Sol 为 1.04 美元。K3 虽显著低于 Anthropic 的 Claude Fable 5(2.75 美元),但与 GPT-5.6 的差距部分源于 token 效率问题:在同一标准化任务中,K3 生成了约 25,000 个输出 token(含约 18,000 个内部推理 token),而 GPT-5.6 Sol 仅用 15,000 个,K3 的输出 token 消耗量高出约 67%。由于推理 token 按输出费率计费,K3 在输出部分相比 Sol 的每 token 50% 折扣实际上缩窄至约 17%。
Reddit 上 LocalLLaMA 用户也指出,一个 2.8 万亿参数 的模型对绝大多数人而言难以本地运行,这一观点在 GLM 5.2 发布后也曾被提及。硬件成本与可本地运行模型的进步速度之间存在巨大落差。
对前沿实验室的真正威胁在于追赶速度
投资者 Gavin Baker 的核心观点是:K3 对前沿美国实验室的威胁,不在于其当前效率,而在于竞争模型逼近前沿的速度。一个接近前沿水平且承诺开放权重的模型,足以限制闭源模型的定价空间,压缩模型层利润率。随着 AI 部署成本降低,采用率和推理需求可能增长,更多价值将向 半导体、电力、云基础设施和软件 转移。因此,K3 当前的算力低效率对模型实验室的利润率是负面因素,但对基础设施需求则是正面因素。
前沿开发者不太可能因此减少投资。每当竞争对手取得进展,其产品相对价值就会下降,从而形成训练下一代模型的压力。更低的推理价格也会催生更多应用和编码智能体(agent),这些智能体会反复调用模型。OpenAI 与英伟达已宣布计划建设至少 10 吉瓦 的 AI 系统,Anthropic 则通过亚马逊、谷歌和博通签署了高达 10 吉瓦的协议。OpenAI 表示,其研究人员中位数 Codex token 使用量在七个月内增长了 56 倍。
更便宜的模型仍需要昂贵的硬件
分析机构 SemiAnalysis 指出,尽管 K3 采用了更高效的注意力机制,但对英伟达仍是利好。该模型 2.8 万亿参数 占用超过 1.5 TB 的 HBM 容量,对 GPU、存储和高速网络提出极高要求。月之暗面的容量短缺已直观展示了推理需求的强劲。英伟达通过其加速器、NVLink 互连、网络产品和 CUDA 软件,在整个算力堆栈中占据位置。
微软可更换模型而不丢失客户
微软通过其与 OpenAI 的关系,在一定程度上暴露于模型经济学走弱的风险。但其更大的优势在于控制着 Azure、Azure AI Foundry 以及企业应用——企业通过这些平台消费 AI。Azure AI Foundry 可根据成本和性能,在 OpenAI、微软及开源模型之间路由工作负载。据报道,微软已开始在某些此前由第三方系统处理的工作负载上使用自研 MAI 模型。如果模型价格下降而使用量增长,微软仍可通过底层计算和分发渠道实现盈利。
据 Insider Monkey 数据库,截至 2026 年第一季度末,持有微软股份的对冲基金为 282 家,低于 2025 年第四季度末的 312 家。
总结而言,Kimi K3 的发布表明,构建模型的公司可能只能捕获其利润的一小部分,而供应和分发计算资源的公司则能获取更大份额。