過去兩週,三家頭部 AI 公司不約而同地把下一代模型先接入了生產環境,卻沒有一家為此召開發佈會。Anthropic 將兩個尚未命名的模型接入生產介面,谷歌為下一代旗艦沿用舊版本號投放到第三方盲測平台,OpenAI 在 Astra 之後未再公開發聲。多數使用者並未意識到,自己已經在為尚未釋出的模型提供測試樣本。

9 月 17 日晚,Anthropic 切斷了灰度通道,一批原本被路由至新模型的賬號歸零,在開發者社群引發集中討論。一天後通道恢復,覆蓋範圍從 Claude Code 擴大至 Chat 和 Cowork。有開發者把這段經歷稱為「午夜驚魂」。同一天晚上,谷歌也被發現了:第三方盲測平台 Arena 上出現了一個代號 gemini-3.8-flash 的模型,抽到的使用者很快注意到異常——它繪製的鵜鶘帶有完整蹬踏動作,生成一張 PS5 向量圖需十分鐘、輸出數千行程式碼,搭建的體素寶塔可在瀏覽器中即時旋轉。3.8 Flash 是早已上線的輕量模型,不具備這樣的能力,社群隨後判斷這是谷歌下一代旗艦 Gemini 4 Pro,內部代號 Argon。被發現後,該名稱又被改為 gemini-3.7-flash。

再往前三天,有開發者發現 Claude Code 介面呼叫的模型標註為 Opus 5,返回結果卻來自另一個模型。對介面請求的抓取顯示,後端模型標識已指向 5.2。Opus 5 釋出於 7 月 24 日,其間沒有 5.1,版本號直接跳至 5.2。此後 Fable 5.2 灰測的訊息一併傳出,一部分原本呼叫 Fable 5.1 的請求被後台路由至新的檢查點。沒有模型卡,沒有 API 標識,也沒有定價表,Anthropic 未作任何說明。

三家的做法並不相同。Anthropic 採用後端路由,前端仍顯示舊名稱,普通使用者無從察覺;谷歌的方式更簡單,在第三方盲測平台上沿用舊版本號;OpenAI 則在 Astra 釋出之後未再公開發聲,公開議題轉到了對手之間的對比上。

對廠商而言,這樣做的收益相當直接:模型在尚未正式命名的階段即可獲得真實負載下的表現資料,一旦出現問題可以隨時回退,無需承擔公開發布失敗的風險。一個前沿模型正式釋出,意味著需要提前配置足以承接瞬時峰值的算力。GPT-6 Astra 動用得州 Stargate 基地超過 10 萬張 GPU 完成訓練,API 定價為每百萬輸入 10 美元、每百萬輸出 50 美元,是上一代 Sol 的 2.5 倍。灰度路由的算力投入遠低於此:新模型混入舊模型流量,廠商可以控制被路由至新模型的請求比例,在觀察真實表現的同時逐步提高佔比。

比成本更難處理的是容錯。6 月 9 日,Fable 5Mythos 5 釋出;三天後的 6 月 12 日,美國商務部下發出口管制指令,要求暫停向任何外籍人士提供這兩個模型。由於無法即時核驗使用者國籍,Anthropic 將模型對全球使用者下線,直到 7 月 1 日 Fable 5 才恢復訪問。一次全量釋出,換來一次全量下架。此後,團隊再做釋出,都會傾向先小範圍釋放、觀察反饋。

口碑的影響更難量化:使用者呼叫的是 Opus 5,實際得到的是 5.2,體驗改善明顯,卻難以歸因。等到開發者社群開始流傳「Claude Code 最近變強了」,傳播已經完成,而官方未作任何說明。

就在 Opus 5.2 被發現的兩天前,Anthropic CEO 達里奧·阿莫代伊發表長文,主張全行業主動放慢前沿模型的迭代速度。他的理由是,模型能力增長過快,安全與對齊工作已經難以跟上;若能放慢一至兩年,並將這段時間用於安全研究,風險將明顯下降。文章發出後,馬斯克與 OpenAI 的 奧特曼均公開表示支援。奧特曼還提到一項具體安排:出於安全考慮,OpenAI 今年不會上市。市場的反應很快,隨後的第一個交易日,費城半導體指數下挫 5.86%輝達下跌 3.36%,全球半導體與 AI 算力硬體產業鏈當日市值蒸發超過 5000 億美元

三家的處境並不相同。OpenAI 月初發布的 GPT-6 Astra 目前佔據約 13% 的企業 AI 支出,Anthropic 的 Fable 系列約為 8%。Anthropic 正在籌備上市,6 月已秘密提交申請,目標估值最高 2 萬億美元,時間視窗定在 11 月中期選舉之前。在這一節點上,一次體驗不佳的主力模型釋出會,會成為路演材料中的不利因素,而 Opus 5 的市場口碑本就偏弱。谷歌的處境更為被動:旗艦 Pro 系列已空缺數月,3.5 Pro 被擱置,算力集中投向 Gemini 4,產品線暫時只能由 Flash 系列支撐。

灰測期間流傳較廣的一種說法,是 Fable 5.2 在最高推理檔位下碾壓了 GPT-6 Astra。這一說法需要分兩層看。它來自一位開發者的個人對比測試,原話是「輸出看起來明顯優於 Astra」,且該開發者同時指出代價是更慢、更貴。另一層背景是,Anthropic 上一代模型本已領先:在 Artificial Analysis 的綜合智慧指數中,Fable 5.1 為 66,Astra 為 61;編碼智慧體指數則為 70 比 67。因此 5.2 碾壓 Astra 未必是誤判,但差距的一部分來自 Astra 自身的基準設定。OpenAI 釋出 Astra 時主推的一項成績,是 ARC-AGI-3 得分 99.9%。但該成績取自 OpenAI 自行配置的 harness;換用行業標準 harness 測同一個模型,得分降至 62.7%,相差 37 個百分點

三個時間點之間的間隔只有十四天:9 月 3 日 GPT-6 Astra 釋出,9 月 14 日 Anthropic 將下一代模型接入介面,9 月 17 日谷歌跟進。接下來有三個時間節點可供確認:Opus 5.2 最快 9 月底、最晚 10 月底全面開放;Gemini 4 Pro 預計 10 月正式釋出;以及 OpenAI 是否會推出新模型,回應這一次「被灰測超越」。預測市場上,9 月 30 日前釋出新 Opus 的機率一度超過八成。截至目前,Opus 5.2 與 Gemini 4 Pro 均無模型卡、API 標識和定價資訊,三家公司都尚未正式表態。