北京時間9月23日,OpenAIAnthropic在相隔約一小時內先後釋出新一輪模型更新。OpenAI推出GPT-6 SolGPT-6 Luna,將本月早些時候GPT-6 Astra上的部分能力繼續下放;Anthropic則釋出Claude Opus 5.5,在強化程式設計與Agent能力之外,把溝通表達單獨列為升級方向。兩家公司在技術層面仍圍繞模型能力、程式設計、Agent和計算機操作展開比較,但開發者社群的關注點已明顯分化。

價格仍是OpenAI最激進的變數。 GPT-6 Sol的API輸入價格從GPT-5.6 Sol促銷價的每百萬Token 4美元降至2美元,輸出從20美元降至10美元;GPT-6 Luna則從0.20美元1.20美元進一步降至0.10美元0.50美元。相比上一代,Sol和Luna的價格大致又下降了一半。OpenAI並未只強調Token單價,而是反覆用“完成一次任務多少錢”來證明這一代產品的方向已從重新整理能力上限,轉向壓低Agent的整體使用成本。

AutomationBench中,Agent需呼叫47種工具完成銷售、營銷、運營、客服、財務和人力資源等業務流程。GPT-6 Sol在xhigh推理強度下得分33.2%,平均單任務成本0.27美元;Claude Opus 5得分26.9%,OpenAI計算其任務成本約為Sol的11.1倍。Claude Fable 5.1配合Opus 5回退時取得31.4%,OpenAI稱其成本至少是Sol的8.9倍,且這一數字尚未完整計入約40%任務回退到Opus 5產生的額外費用。在覆蓋55個細分行業的Agents’ Last Exam中,OpenAI同樣把重點放在“接近或超過高階模型能力,但顯著降低任務成本”上。

程式設計場景更能體現這種策略。在DeepSWE 1.1中,GPT-6 Sol最高推理強度得到68.8%,與Claude Fable 5 xhigh的69.9%只差1.1個百分點,但OpenAI稱其單任務成本低約80%;GPT-6 Luna則達到66.6%,接近Claude Opus 5和Fable 5中等推理強度的水平,而按OpenAI測算,完成同類任務的成本分別比Opus 5低約93%、比Fable 5低約96%。Luna獲得的正面評價尤其集中在價效比上,有使用者驚訝於這樣一個已經相當便宜的模型還能再次降價,也有人表示已開始把部分生產分類任務遷移到GPT-6 Luna。

不過,這種反饋同時暴露了GPT-6的另一面:一些開發者並未感受到很強的“6代躍遷”,原本期待Sol明顯接近Astra,實際體驗卻更像一個更成熟、更便宜的GPT-5.6 Sol。有人乾脆把這次釋出概括為“主要是一次成本勝利”。

Anthropic面對的問題則完全不同。 上一代Opus 5並非能力不強,它在不少基準測試上已處於很高位置,但真實使用口碑明顯分化。一些開發者認為它程式設計正確性不錯,卻容易出現表達冗長、術語奇怪、註釋過多、過度設計以及擅自擴大任務範圍等問題。甚至有使用者指出,Opus 5在不少基準上已與Fable接近,但自己在實際程式設計中仍幾乎全部使用Fable。

因此,Opus 5.5這次把溝通表達單獨列出來並不奇怪。Anthropic強調,新模型會減少不必要的術語和特殊措辭,把重要資訊放在前面,並改善長時間協作中的可讀性。同時,Opus 5.5典型工作負載成本相比Opus 5下降40%,輸出速度提升30%以上,Cache Read價格下降60%。這次降價,Anthropic也在試圖解決“最強模型能不能重新變成開發者願意連續使用幾個小時的工具”的成本問題。

程式設計仍是主戰場,但開發者越來越不相信幾分基準差距。 在OpenAI公佈的部分程式設計評測中,GPT-6 Sol已逼近Claude此前的高階模型。但過去幾輪發布已讓很多人意識到,軟體工程基準裡的幾分差距很難穩定對映到真實使用體驗。Opus 5就是一個典型例子:它釋出時擁有漂亮的成績,但仍有不少開發者認為它在真實專案裡難用;與此同時,也有另一批使用者認為高推理強度下的Opus 5已是非常強的程式設計師,甚至能根據剛發表的論文完成演算法實現。

“到底好不好用”,除了模型,也越來越依賴任務型別、程式碼庫結構、工作流以及開發者自己的Agent Harness,而不是一張統一榜單。這也是為什麼Opus 5.5雖然獲得了明顯更積極的早期評價,社群態度仍帶有很強的“先用幾周再說”。一些長期在Fable、Opus和OpenAI模型之間切換的開發者已考慮把5.5重新作為主力,也有人認為其表達風格確實改善,但“基準好看”已不足以直接建立信任。Anthropic自己也承認,當模型能力達到目前水平之後,評測之間幾個百分點的差距越來越難直接對映成現實體驗。

原因在於,真實軟體工程從來不只是“寫出一段能通過測試的程式碼”。歷史程式碼、技術債、架構約束、模糊需求、團隊規範、長期維護性,以及“哪些地方不能碰”,都很難被單一基準完整覆蓋。一個模型即使第一次寫出的程式碼完全正確,如果它修改了大量無關檔案、進行了不必要的重構,或者需要開發者花大量時間理解和返工,實際生產力仍可能低於一個跑分稍低、但行為更穩定的模型。因此,程式設計模型的評價物件不再是“能不能生成正確程式碼”,而是Agent完成一次軟體工程任務的全過程質量:它用了多少步驟、改了多少無關內容、有沒有理解邊界、是否容易複核,以及最終需要多少人工介入。

當Agent連續工作數小時,價格戰開始拼“快取階段”。 這次釋出,OpenAI開始明顯把Prompt Caching當成Agent降本的核心能力,而不再只是把它當作底層推理最佳化。OpenAI披露,其內部研究人員過去一年對程式設計Agent的使用量快速增加,如果按照API價格折算,一名研究人員每天使用程式設計Agent產生的Token成本中位數已超過600美元,前10%的研究人員甚至超過7000美元。當Agent開始持續執行,大量成本並非來自新的問題,而是來自同一批程式碼、工具定義、歷史對話和任務狀態被反覆重新處理。

GPT-6因此進一步調整了Prompt Caching機制。已命中的快取輸入Token可獲得90%的價格折扣,同時減少重複Prefill帶來的計算開銷和延遲。OpenAI還新增Prompt Caching Dashboard和診斷工具,讓開發者看到哪些Prompt成功命中快取、哪些沒有;過去調整Reasoning Effort或動態啟停工具容易讓快取失效,現在GPT-6可以在不破壞既有快取的情況下調整推理強度,並通過保持工具定義穩定、動態控制工具可用性來提高快取複用率,並允許開發者顯式設定快取字首斷點。資料顯示,過去幾個月的這些改進,已讓GitHub Copilot在數十億次OpenAI模型請求中需要重新處理的Prompt Token比例下降超過50%

這類變化也直接引起了開發者注意。一些生產Agent使用者指出,自己的實際賬單中,Cache Read本身就可能佔據相當大比例。因此,即使一個模型普通Input Token價格便宜一半,如果快取利用率更低,最終任務成本也未必真能便宜一半。Anthropic其實也在向同一個方向調整。Opus 5.5將Cache Read價格降低60%,並非孤立的價格變化,而是在適應同一種長週期Agent工作負載。對於長上下文程式設計Agent來說,快取利用率、上下文複用和工具呼叫策略正在成為與模型本身同樣重要的經濟變數。

兩家公司也都在改進使用體驗。 OpenAI同時把Astra上的部分回答風格調整帶到了Sol和Luna,包括減少術語堆砌、奇怪措辭和低價值細節,回答整體稍短,並在程式設計任務中更清楚地區分“做了什麼、驗證了什麼、哪些事情沒有驗證”。這一點和Anthropic這次的方向其實非常接近,只不過Anthropic面臨的是更明確的歷史包袱:上一代Opus已因表達方式和工作習慣收到大量負面反饋,因此5.5更像一次有針對性的使用體驗修復。

Opus 5.5目前另一個爭議來自安全限制。一些早期使用者報告,普通Bash操作偶爾會被判斷成“Third-Party Attack”,從而阻斷正常工作流。Anthropic此次進一步加入針對Agent每一步動作的分類器,並強化Prompt Injection防禦。對企業Agent而言,更嚴格的安全防護當然有現實價值,但對程式設計Agent來說,現實的問題是:如果模型什麼都會,卻頻繁因為安全系統不讓做,那麼能力本身就很難完全轉化為生產力。

從這次同日釋出可以看出,模型競爭的重心正在從“誰的API單價更低”轉向“誰能讓Agent在真實工作流裡跑得更久、更省、更少返工”。對投資者而言,這意味著評估模型廠商的競爭力,不能只看基準分數或Token標價,還要看快取效率、任務完成成本和開發者留存意願——這些指標將直接影響推理算力的實際消耗節奏與AI應用層的毛利空間。