Anthropic 正式釋出 Claude Sonnet 5.5,這是其 Claude 5.5 家族的第二款模型。官方稱該模型輸出生成速度提升超過 30%,通過更高效的 token 使用,單任務成本最多可降低 30%,同時在多項知識工作基準上逼近旗艦級的 Opus 5.5。模型即日起在 AWS、Google Cloud 和 Microsoft Azure 三大雲平台上線。

從定位看,Opus 5.5 面向需要審慎判斷的複雜任務,而 Sonnet 5.5 瞄準定義清晰的日常工作,例如修復 bug、撰寫文件、製作簡報和電子表格。Anthropic 還預告將在未來數週推出 Claude Haiku 5.5,主打高吞吐、低成本場景。

編碼能力提升最為顯著。 在面向智慧體編碼的 Terminal-Bench 4.0 上,Sonnet 5.5 得分達到 70.6%,而上一代 Sonnet 5 僅為 10.3%。在還原 Cursor 編輯器真實編碼會話的 CursorBench 4.0 上,Sonnet 5.5 取得 55.5%,高於 Sonnet 5 的 34.1%,僅比 Opus 5.5 的 57.8% 低兩個百分點。在 FrontierCode 1.1 的 High 設定下,Anthropic 稱 Sonnet 5.5 比 Sonnet 5 高出十分,而單任務成本約為後者的十五分之一。早期測試者稱讚該模型理解程式碼庫的速度。

推理強度設定出現一個反常現象。 在最高檔 Max 下,Sonnet 5.5 在 FrontierCode 上的得分反而低於 Xhigh 檔。Anthropic 解釋稱,在最大努力檔位下,模型更頻繁觸發程式碼審查功能,將工作拆分給多個子智慧體,有時導致超時或超出任務範圍的改動,而這兩者都會被 FrontierCode 扣分。

知識工作基準幾乎追平 Opus 5.5。 在 OpenAI 開發、覆蓋 44 個職業和 9 個行業任務的 GDPval-AA 上,Sonnet 5.5 得 1,844 分,與 Opus 5.5 的 1,846 分幾乎持平,比 Sonnet 5 的 1,449 分高出約 400 分。按 Anthropic 給出的資料,OpenAI 的 GPT-6 Sol 為 1,487 分。在圖表識別測試 Chartography 上,Sonnet 5.5 從 15.6% 躍升至 61.6%。

其他基準方面,AA Briefcase v1.1 上 Sonnet 5.5 得 1,811 分(Sonnet 5 為 1,359,Opus 5.5 為 1,822,GPT-6 Sol 為 1,483);帶工具的人類最後考試(Humanity's Last Exam)得 64.5%(Sonnet 5 為 54.9%,Opus 5.5 為 67.7%);OSWorld 2.1 部分評估得 80.1%(Sonnet 5 為 57.0%,Opus 5.5 為 81.8%)。需注意,Anthropic 標註 Sonnet 5.5 的 GDPval-AA 與 AA Briefcase 數值來自預釋出版本,一個此後已修復的 bug 可能影響過結構化輸出。

定價策略是本次釋出的關鍵看點。 Sonnet 5.5 每百萬 token 價格與 Sonnet 5 持平:輸入 2 美元、輸出 10 美元、快取讀取 0.20 美元。由於單任務消耗 token 更少,實際成本最多下降 30%。作為對比,Opus 5.5 輸入 4 美元、輸出 20 美元;GPT-6 Sol 輸入 2 美元、輸出 10 美元;GPT-6 Luna 輸入 0.10 美元、輸出 0.50 美元。Anthropic 表示,在低或中等努力檔位下,Sonnet 5.5 已能在多項基準上超過 Sonnet 5 的最佳成績,而單任務成本僅約十分之一。

競爭格局上, Anthropic 已用 Fable、Opus、Sonnet 三檔對應 OpenAI 的 GPT-6 Astra、Sol、Luna,但整體定價更高。各對應檔位之間的效能差距已小到成本可能成為決定性因素,Haiku 5.5 有望幫助 Anthropic 縮小這一差距。Anthropic 還稱,Sonnet 5.5 是首個僅憑截圖就能通關《寶可夢紅》的 Sonnet 模型,這類任務在幾年前還需定製演算法。

安全方面, 針對能力更強的模型,Anthropic 新增了網路安全風險與蒸餾攻擊的防護措施。早期測試者形容 Sonnet 5.5 是更自然的對話夥伴,對設計有感覺,能重做使用者介面並執行幻燈片模板,成果幾乎無需修改。不過,官方給出的速度與成本資料仍需獨立測試驗證。