月之暗面发布的Kimi K3模型,凭借2.8万亿参数和面向100万token上下文窗口的设计,再次将AI投资者的注意力引向一个核心问题:模型变得更便宜、更高效,是否意味着芯片和内存需求将下降?花旗和美银证券的分析均给出了否定答案,认为效率提升可能释放更多使用量,进而推高总资源消耗,这一现象被称为“杰文斯悖论”。
花旗半导体分析师Peter Lee指出,即便Kimi K3被广泛使用,服务器DDR5和eSSD等通用内存需求仍会增加。美银证券半导体分析师Vivek Arya在7月17日的研究中也认为,美国前沿AI实验室更可能增加算力投入,而不是减少。若中国开源模型持续逼近,OpenAI、Anthropic和Google等领先者需要用更大训练规模、更重推理和更快产品迭代来维持差异化。
Kimi K3的吸引力来自其低成本与高性能组合。公开价格显示,其缓存命中输入价格为每百万token 0.3美元,输出价格为每百万token 15美元。模型完整权重计划于7月27日披露,目标是支持长周期智能体工作。花旗判断,模型降价不会自动减少硬件需求,低成本可能提高开发者和企业调用模型的意愿,推动更多AI智能体部署。智能体任务并非一次性问答,而是在连续任务中不断生成、读取和处理token,调用次数和任务长度上升,会把单位成本下降重新转化为总资源消耗。
Kimi K3采用三项关键技术:Kimi Delta Attention、Attention Residuals和Stable LatentMoE。其中,Kimi Delta Attention用于降低100万token上下文窗口的成本,Stable LatentMoE则提升稀疏化程度,每个token仅激活896个专家中的16个。月之暗面称,这套架构使Kimi K3的扩展效率达到K2的2.5倍。但花旗强调,这并不等于推理端资源压力消失,Kimi K3运行仍需要多节点集群,超级节点配置超过64颗GPU。长上下文和智能体任务会推高KV Cache占用,进而增加推理端内存负担,直接关联服务器DDR5和eSSD需求。
美银证券的结论与花旗形成呼应,但关注点更偏向GPU和AI基础设施。Vivek Arya认为,更强的中国开源模型未必会让美国AI巨头削减算力投入。相反,模型差距收窄会提高领先者维持优势的成本。当模型能力趋同,竞争压力会传导至底层基础设施,包括GPU、HBM、高速网络和推理系统。
美银证券还引用OpenRouter数据指出,模型调用量仍在快速增加,其中中国AI实验室模型的token使用量已经超过非中国实验室模型。Ramp数据显示,截至2026年6月,约55%的美国企业已付费订阅AI模型、平台或工具,高于美国人口普查局BTOS调查的21%估计。按模型看,Anthropic企业采用率为42.4%,OpenAI为39.5%。不过,AI支出仍高度集中,头部1%的企业用户平均每名员工每月AI支出约4833美元,整体中位数仅为11美元。这组数据支持一个判断:AI使用仍处于扩散过程中,低价模型可能进一步推动增量需求。
花旗和美银证券的共同结论是,Kimi K3的意义不在于单一模型是否降低单位推理成本,而在于低成本是否释放更大规模的工作负载。对花旗而言,最直接的受益方向是服务器DDR5和eSSD;对美银证券而言,更重要的是GPU、HBM、高速网络和推理系统。效率提升之后,市场需要关注的可能是更多token、更多推理,以及更多底层硬件消耗。