月之暗面釋出的Kimi K3模型,憑藉2.8萬億引數和麵向100萬token上下文視窗的設計,再次將AI投資者的注意力引向一個核心問題:模型變得更便宜、更高效,是否意味著晶片和記憶體需求將下降?花旗和美銀證券的分析均給出了否定答案,認為效率提升可能釋放更多使用量,進而推高總資源消耗,這一現象被稱為“傑文斯悖論”

花旗半導體分析師Peter Lee指出,即便Kimi K3被廣泛使用,伺服器DDR5eSSD等通用記憶體需求仍會增加。美銀證券半導體分析師Vivek Arya在7月17日的研究中也認為,美國前沿AI實驗室更可能增加算力投入,而不是減少。若中國開源模型持續逼近,OpenAIAnthropicGoogle等領先者需要用更大訓練規模、更重推理和更快產品迭代來維持差異化。

Kimi K3的吸引力來自其低成本與高效能組合。公開價格顯示,其快取命中輸入價格為每百萬token 0.3美元,輸出價格為每百萬token 15美元。模型完整權重計劃於7月27日披露,目標是支援長週期智慧體工作。花旗判斷,模型降價不會自動減少硬體需求,低成本可能提高開發者和企業呼叫模型的意願,推動更多AI智慧體部署。智慧體任務並非一次性問答,而是在連續任務中不斷生成、讀取和處理token,呼叫次數和任務長度上升,會把單位成本下降重新轉化為總資源消耗。

Kimi K3採用三項關鍵技術:Kimi Delta AttentionAttention ResidualsStable LatentMoE。其中,Kimi Delta Attention用於降低100萬token上下文視窗的成本,Stable LatentMoE則提升稀疏化程度,每個token僅啟用896個專家中的16個。月之暗面稱,這套架構使Kimi K3的擴充套件效率達到K2的2.5倍。但花旗強調,這並不等於推理端資源壓力消失,Kimi K3執行仍需要多節點叢集,超級節點配置超過64顆GPU長上下文和智慧體任務會推高KV Cache佔用,進而增加推理端記憶體負擔,直接關聯伺服器DDR5和eSSD需求。

美銀證券的結論與花旗形成呼應,但關注點更偏向GPU和AI基礎設施。Vivek Arya認為,更強的中國開源模型未必會讓美國AI巨頭削減算力投入。相反,模型差距收窄會提高領先者維持優勢的成本。當模型能力趨同,競爭壓力會傳導至底層基礎設施,包括GPUHBM、高速網路和推理系統。

美銀證券還引用OpenRouter資料指出,模型呼叫量仍在快速增加,其中中國AI實驗室模型的token使用量已經超過非中國實驗室模型。Ramp資料顯示,截至2026年6月,約55%的美國企業已付費訂閱AI模型、平台或工具,高於美國人口普查局BTOS調查的21%估計。按模型看,Anthropic企業採用率為42.4%,OpenAI為39.5%。不過,AI支出仍高度集中,頭部1%的企業使用者平均每名員工每月AI支出約4833美元,整體中位數僅為11美元。這組資料支援一個判斷:AI使用仍處於擴散過程中,低價模型可能進一步推動增量需求。

花旗和美銀證券的共同結論是,Kimi K3的意義不在於單一模型是否降低單位推理成本,而在於低成本是否釋放更大規模的工作負載。對花旗而言,最直接的受益方向是伺服器DDR5和eSSD;對美銀證券而言,更重要的是GPU、HBM、高速網路和推理系統。效率提升之後,市場需要關注的可能是更多token、更多推理,以及更多底層硬體消耗。