《The Decoder》前沿雷達第4期指出,中國AI模型已追平美國頂尖水平,西方實驗室的領先優勢正縮至狹窄領域。本期由編輯團隊撰寫,聚焦中國模型如何趕超、西方實驗室還能在哪些方面保持優勢,以及產業護城河為何已從模型本身轉向圍繞模型的整體系統。

一年半前,DeepSeek R1 曾引發市場震動,中國實驗室突然與 OpenAI 的 o1 推理模型競爭,且據報成本遠低。當時市場恐慌,數日內蒸發數十億美元市值。但當時情況比頭條更復雜:DeepSeek 報告顯示,R1 在 AIME 2024 等單項測試中勝過 o1,但在事實知識(SimpleQA)等測試上明顯落後。後續基準測試暴露更多差距,中國模型僅在個別學科領先,而非全面。截至今年6月底,Z.ai 的 GLM-5.2 仍呈現同樣模式。

然而,最新一批中國開源權重模型——Moonshot 的 Kimi K3、阿里巴巴的 Qwen3.8-Max 和 GLM-5.3——如今在幾乎所有廣泛且嚴格的評估中接近榜首。它們處理長知識任務、多步驟編碼和工具協調的能力遠超前輩。按常見基準衡量,常被引用的“幾個月差距”已縮小到足以成為投資者的問題。據《華爾街日報》報道,Anthropic 在即將進行的 IPO 前正面臨棘手提問,並以剩餘頂尖優勢作為辯護。在該層級之下,領域主要屬於來自中國的開放、便宜得多的模型。投資者擔心,原始模型效能已難以支撐業務——今天一個模型能獨佔的功能,幾個月後免費下載的模型也能做到。

西方實驗室提出兩項指控:中國實驗室涉嫌使用西方模型作為教師,即“蒸餾”實踐;以及他們針對基準分數調優模型,卻缺乏廣泛能力,即“刷榜”。美國領先並未消失,但已退縮到所謂“前沿”的少數日益狹窄領域。本期第一個問題是:領先優勢還在哪裡,經濟價值幾何?第二個問題隨之而來:如果模型本身不再能拉開明顯差距,領先靠什麼支撐?編輯團隊的觀點是:越來越少靠模型,越來越多靠圍繞模型的整體系統,即持續工作產生下一代模型的系統。

在具體資料上,Kimi K3 釋出時在 Artificial Analysis 的智慧指數上以 57 分位列第三,僅次於當時的領先者 GPT-5.5 和 Opus 4.8。K3 在代理任務上提升最大,這正是企業使用的實操工作。在 AutomationBench-AA 上,K3 甚至首發登頂,直到 Anthropic 用 Opus 5 回應。在 CEO-Bench(代理模擬運營一家虛構軟體公司 500 天)上,K3 以 2215 萬美元的最佳單次執行成績領先。中國模型(包括其前代 K2.7)此前常在這些長程任務中失敗。Qwen3.8-Max 也達到類似高水平。一個注意事項:較新的中國模型有時比西方模型消耗更多 token,這侵蝕了部分價格優勢,每任務成本計算仍適用。

當前模型能力的邊緣以不均勻速度增長,研究人員稱之為“鋸齒狀前沿”。各能力發展速度不同,因此常被引用的“幾個月差距”總取決於誰在測量什麼。新的變化是,西方領先還能在哪些領域被測量到。三個領域仍然存在。第一是抽象專業測試:K3 釋出後不久,Opus 5 以 61 分重奪指數榜首,小幅領先 K3 的 57 分。在 ARC-AGI-1(用小謎題網格測試抽象模式識別)上,K3 和 Anthropic 的編碼與代理旗艦線 Fable 5 幾乎持平,分別為 94.5% 和 98.5%。但在 ARC-AGI-2 上差距擴大:60.4% 對 89.2%。不過 ARC-AGI 刻意測量遠離日常任務的抽象模式識別,這一差距未必預示實際差異,可能在經濟上大多無關緊要。

第二是可靠性。8月12日釋出的 AA-AnalystAgent 基準測試,在真實表格和文件上測試代理資料分析,僅當模型在五次獨立執行中全部正確才算解決,即 pass^5。Opus 5 以 54% 領先,GPT-5.5 為 50%,K3 是表現最佳的開源模型,達 39%。差距幾乎完全來自重複性差:K3 在五次嘗試中至少一次解決 73% 的任務,與 Opus 5 的 74% 幾乎持平。可靠性也不遵循通常的智慧指數排名,甚至 GPT-5.6 Sol 在此落後於其前代。商業上,可靠性至關重要,因為企業無法依賴偶爾成功的模型。

本期還提出,歐洲正在同時輸掉兩場比賽。編輯團隊認為,模型領先無法防守,護城河已從模型轉向系統——即持續產生下一代模型的整體工程與資料飛輪。西方實驗室若想保持優勢,需在可靠性、抽象推理等窄領域深耕,並構建難以複製的系統級壁壘。