《The Decoder》前沿雷达第4期指出,中国AI模型已追平美国顶尖水平,西方实验室的领先优势正缩至狭窄领域。本期由编辑团队撰写,聚焦中国模型如何赶超、西方实验室还能在哪些方面保持优势,以及产业护城河为何已从模型本身转向围绕模型的整体系统。

一年半前,DeepSeek R1 曾引发市场震动,中国实验室突然与 OpenAI 的 o1 推理模型竞争,且据报成本远低。当时市场恐慌,数日内蒸发数十亿美元市值。但当时情况比头条更复杂:DeepSeek 报告显示,R1 在 AIME 2024 等单项测试中胜过 o1,但在事实知识(SimpleQA)等测试上明显落后。后续基准测试暴露更多差距,中国模型仅在个别学科领先,而非全面。截至今年6月底,Z.ai 的 GLM-5.2 仍呈现同样模式。

然而,最新一批中国开源权重模型——Moonshot 的 Kimi K3、阿里巴巴的 Qwen3.8-Max 和 GLM-5.3——如今在几乎所有广泛且严格的评估中接近榜首。它们处理长知识任务、多步骤编码和工具协调的能力远超前辈。按常见基准衡量,常被引用的“几个月差距”已缩小到足以成为投资者的问题。据《华尔街日报》报道,Anthropic 在即将进行的 IPO 前正面临棘手提问,并以剩余顶尖优势作为辩护。在该层级之下,领域主要属于来自中国的开放、便宜得多的模型。投资者担心,原始模型性能已难以支撑业务——今天一个模型能独占的功能,几个月后免费下载的模型也能做到。

西方实验室提出两项指控:中国实验室涉嫌使用西方模型作为教师,即“蒸馏”实践;以及他们针对基准分数调优模型,却缺乏广泛能力,即“刷榜”。美国领先并未消失,但已退缩到所谓“前沿”的少数日益狭窄领域。本期第一个问题是:领先优势还在哪里,经济价值几何?第二个问题随之而来:如果模型本身不再能拉开明显差距,领先靠什么支撑?编辑团队的观点是:越来越少靠模型,越来越多靠围绕模型的整体系统,即持续工作产生下一代模型的系统。

在具体数据上,Kimi K3 发布时在 Artificial Analysis 的智能指数上以 57 分位列第三,仅次于当时的领先者 GPT-5.5 和 Opus 4.8。K3 在代理任务上提升最大,这正是企业使用的实操工作。在 AutomationBench-AA 上,K3 甚至首发登顶,直到 Anthropic 用 Opus 5 回应。在 CEO-Bench(代理模拟运营一家虚构软件公司 500 天)上,K3 以 2215 万美元的最佳单次运行成绩领先。中国模型(包括其前代 K2.7)此前常在这些长程任务中失败。Qwen3.8-Max 也达到类似高水平。一个注意事项:较新的中国模型有时比西方模型消耗更多 token,这侵蚀了部分价格优势,每任务成本计算仍适用。

当前模型能力的边缘以不均匀速度增长,研究人员称之为“锯齿状前沿”。各能力发展速度不同,因此常被引用的“几个月差距”总取决于谁在测量什么。新的变化是,西方领先还能在哪些领域被测量到。三个领域仍然存在。第一是抽象专业测试:K3 发布后不久,Opus 5 以 61 分重夺指数榜首,小幅领先 K3 的 57 分。在 ARC-AGI-1(用小谜题网格测试抽象模式识别)上,K3 和 Anthropic 的编码与代理旗舰线 Fable 5 几乎持平,分别为 94.5% 和 98.5%。但在 ARC-AGI-2 上差距扩大:60.4% 对 89.2%。不过 ARC-AGI 刻意测量远离日常任务的抽象模式识别,这一差距未必预示实际差异,可能在经济上大多无关紧要。

第二是可靠性。8月12日发布的 AA-AnalystAgent 基准测试,在真实表格和文档上测试代理数据分析,仅当模型在五次独立运行中全部正确才算解决,即 pass^5。Opus 5 以 54% 领先,GPT-5.5 为 50%,K3 是表现最佳的开源模型,达 39%。差距几乎完全来自重复性差:K3 在五次尝试中至少一次解决 73% 的任务,与 Opus 5 的 74% 几乎持平。可靠性也不遵循通常的智能指数排名,甚至 GPT-5.6 Sol 在此落后于其前代。商业上,可靠性至关重要,因为企业无法依赖偶尔成功的模型。

本期还提出,欧洲正在同时输掉两场比赛。编辑团队认为,模型领先无法防守,护城河已从模型转向系统——即持续产生下一代模型的整体工程与数据飞轮。西方实验室若想保持优势,需在可靠性、抽象推理等窄领域深耕,并构建难以复制的系统级壁垒。