Anthropic 正式发布 Claude Sonnet 5.5,这是其 Claude 5.5 家族的第二款模型。官方称该模型输出生成速度提升超过 30%,通过更高效的 token 使用,单任务成本最多可降低 30%,同时在多项知识工作基准上逼近旗舰级的 Opus 5.5。模型即日起在 AWS、Google Cloud 和 Microsoft Azure 三大云平台上线。
从定位看,Opus 5.5 面向需要审慎判断的复杂任务,而 Sonnet 5.5 瞄准定义清晰的日常工作,例如修复 bug、撰写文档、制作演示文稿和电子表格。Anthropic 还预告将在未来数周推出 Claude Haiku 5.5,主打高吞吐、低成本场景。
编码能力提升最为显著。 在面向智能体编码的 Terminal-Bench 4.0 上,Sonnet 5.5 得分达到 70.6%,而上一代 Sonnet 5 仅为 10.3%。在还原 Cursor 编辑器真实编码会话的 CursorBench 4.0 上,Sonnet 5.5 取得 55.5%,高于 Sonnet 5 的 34.1%,仅比 Opus 5.5 的 57.8% 低两个百分点。在 FrontierCode 1.1 的 High 设置下,Anthropic 称 Sonnet 5.5 比 Sonnet 5 高出十分,而单任务成本约为后者的十五分之一。早期测试者称赞该模型理解代码库的速度。
推理强度设置出现一个反常现象。 在最高档 Max 下,Sonnet 5.5 在 FrontierCode 上的得分反而低于 Xhigh 档。Anthropic 解释称,在最大努力档位下,模型更频繁触发代码审查功能,将工作拆分给多个子智能体,有时导致超时或超出任务范围的改动,而这两者都会被 FrontierCode 扣分。
知识工作基准几乎追平 Opus 5.5。 在 OpenAI 开发、覆盖 44 个职业和 9 个行业任务的 GDPval-AA 上,Sonnet 5.5 得 1,844 分,与 Opus 5.5 的 1,846 分几乎持平,比 Sonnet 5 的 1,449 分高出约 400 分。按 Anthropic 给出的数据,OpenAI 的 GPT-6 Sol 为 1,487 分。在图表识别测试 Chartography 上,Sonnet 5.5 从 15.6% 跃升至 61.6%。
其他基准方面,AA Briefcase v1.1 上 Sonnet 5.5 得 1,811 分(Sonnet 5 为 1,359,Opus 5.5 为 1,822,GPT-6 Sol 为 1,483);带工具的人类最后考试(Humanity's Last Exam)得 64.5%(Sonnet 5 为 54.9%,Opus 5.5 为 67.7%);OSWorld 2.1 部分评估得 80.1%(Sonnet 5 为 57.0%,Opus 5.5 为 81.8%)。需注意,Anthropic 标注 Sonnet 5.5 的 GDPval-AA 与 AA Briefcase 数值来自预发布版本,一个此后已修复的 bug 可能影响过结构化输出。
定价策略是本次发布的关键看点。 Sonnet 5.5 每百万 token 价格与 Sonnet 5 持平:输入 2 美元、输出 10 美元、缓存读取 0.20 美元。由于单任务消耗 token 更少,实际成本最多下降 30%。作为对比,Opus 5.5 输入 4 美元、输出 20 美元;GPT-6 Sol 输入 2 美元、输出 10 美元;GPT-6 Luna 输入 0.10 美元、输出 0.50 美元。Anthropic 表示,在低或中等努力档位下,Sonnet 5.5 已能在多项基准上超过 Sonnet 5 的最佳成绩,而单任务成本仅约十分之一。
竞争格局上, Anthropic 已用 Fable、Opus、Sonnet 三档对应 OpenAI 的 GPT-6 Astra、Sol、Luna,但整体定价更高。各对应档位之间的性能差距已小到成本可能成为决定性因素,Haiku 5.5 有望帮助 Anthropic 缩小这一差距。Anthropic 还称,Sonnet 5.5 是首个仅凭截图就能通关《宝可梦红》的 Sonnet 模型,这类任务在几年前还需定制算法。
安全方面, 针对能力更强的模型,Anthropic 新增了网络安全风险与蒸馏攻击的防护措施。早期测试者形容 Sonnet 5.5 是更自然的对话伙伴,对设计有感觉,能重做用户界面并执行幻灯片模板,成果几乎无需修改。不过,官方给出的速度与成本数据仍需独立测试验证。