月之暗面(Kimi)于7月19日发布的开源模型K3,在48小时内引发全球AI产业剧烈震荡。该模型在评测机构Artificial Analysis的智能指数中拿到57分,排名全球第三,仅次于Anthropic的Claude Fable 5(60分)和OpenAI的GPT-5.6 Sol(59分),超越Claude Opus 4.8(56分)等多款顶尖模型。K3也是全球首个开源的3万亿级别模型,总参数达2.8万亿,单个任务成本仅0.94美元,约为Claude Opus 4.8(1.80美元)的一半。
K3的爆火直接导致Kimi服务器承受巨大压力。7月19日深夜,Kimi官方发布公告称,K3请求量大幅超出预估,逼近现有算力集群承载极限。为保障已订阅用户体验,即日起暂停C端新用户会员订阅,将全部算力留给老用户。同时,会员体系拆分为Kimi主权益(Web、App、Work)和Kimi Code权益,以精准分配算力。
资本市场反应剧烈。K3发布后的首个交易日,英伟达单日市值蒸发约1111亿美元,与2025年1月DeepSeek发布时的情况如出一辙。费城半导体指数当周下跌12.5%,创15个月来最差单周表现。摩根大通策略师在报告中直接称之为“DeepSeek 2.0”。美国国家前AI事务负责人、现任总统科技顾问委员会联席主席大卫·塞克斯(David Sacks)发文表示,这是中国模型第一次在前端编程赛道拿下第一,照此以往美国将输掉AI竞赛。加州大学伯克利分校教授、Databricks联合创始人伊翁·斯托伊卡(Ion Stoica)指出,过去开源模型比最先进模型落后六到九个月,现在这个差距已缩小到两到三个月。
K3的核心技术源于月之暗面两年前提出的RL Scaling(强化学习扩展)路线。与传统的“死记硬背”式Scaling Law不同,RL Scaling让模型学会自我纠错:先尝试解题,自动打分,发现错误后回溯修改,并将经验记录下来。这一思路最早在K0-Math模型上验证,其数学成绩超过了OpenAI当时最强的推理模型o1。K3将RL Scaling能力从数学扩展至全场景,形成“生成—看效果—迭代”的视觉闭环(Vision in the Loop)。技术报告展示,K3能独立编写3D开放世界游戏、剪辑发布预告片,并实现帧级精准节拍同步(frame-accurate beat synchronization)。
尽管综合评分接近顶尖,K3在多项关键指标上仍存差距。在真实代码库长程工程基准DeepSWE中,GPT-5.6 Sol得73.0分,Fable 5得70.0分,K3为67.5分;高难度视觉推理测试Zerobench中,Fable 5以46.0分领先K3的41.0分。K3在长时间、多步骤的复杂工程任务上逊于前两者。技术报告还承认两个部署缺陷:一是对推理历史传递要求极高,切换框架可能导致输出质量骤降;二是在任务模糊时倾向于“过度主动”,替用户做决定,可能引发连锁错误。更关键的是,Artificial Analysis测评指出,K3的幻觉率比上一代K2.6反而上升,对长程编程任务尤为致命。
K3的冲击迫使Anthropic连夜调整策略。原本计划将Fable 5从订阅制中下架、转为纯按量计费,但K3发布后第二天,Anthropic突然改口,宣布Fable 5永久保留在订阅方案中,并为Max和Team Premium用户提供50%额度补偿,Pro和Team Standard用户获得100美元一次性额度。此举意在K3热潮中留住客户。
月之暗面创始人杨植麟的创业选择也引发讨论。其CMU导师、苹果首任AI总监鲁斯兰·萨拉霍丁诺夫(Ruslan Salakhutdinov)澄清,杨植麟并非因签证问题离开美国,而是坚定回国创业。杨植麟曾表示,大厂科学家缺乏推动产品落地的资源与权力,他需要同时研究基础模型和做出产品。联合创始人周昕宇、陈麒聪、张宇韬均来自清华,创业启动成本远低于在美国从零组建团队。
K3的发布标志着中国开源模型首次在全球前端编程赛道登顶,但幻觉率、部署架构依赖等短板仍需解决。这场震荡也再次证明,模型性能的快速迭代正深刻改变AI产业链的估值逻辑与竞争格局。