北京时间9月23日,OpenAIAnthropic在相隔约一小时内先后发布新一轮模型更新。OpenAI推出GPT-6 SolGPT-6 Luna,将本月早些时候GPT-6 Astra上的部分能力继续下放;Anthropic则发布Claude Opus 5.5,在强化编程与Agent能力之外,把沟通表达单独列为升级方向。两家公司在技术层面仍围绕模型能力、编程、Agent和计算机操作展开比较,但开发者社区的关注点已明显分化。

价格仍是OpenAI最激进的变量。 GPT-6 Sol的API输入价格从GPT-5.6 Sol促销价的每百万Token 4美元降至2美元,输出从20美元降至10美元;GPT-6 Luna则从0.20美元1.20美元进一步降至0.10美元0.50美元。相比上一代,Sol和Luna的价格大致又下降了一半。OpenAI并未只强调Token单价,而是反复用“完成一次任务多少钱”来证明这一代产品的方向已从刷新能力上限,转向压低Agent的整体使用成本。

AutomationBench中,Agent需调用47种工具完成销售、营销、运营、客服、财务和人力资源等业务流程。GPT-6 Sol在xhigh推理强度下得分33.2%,平均单任务成本0.27美元;Claude Opus 5得分26.9%,OpenAI计算其任务成本约为Sol的11.1倍。Claude Fable 5.1配合Opus 5回退时取得31.4%,OpenAI称其成本至少是Sol的8.9倍,且这一数字尚未完整计入约40%任务回退到Opus 5产生的额外费用。在覆盖55个细分行业的Agents’ Last Exam中,OpenAI同样把重点放在“接近或超过高端模型能力,但显著降低任务成本”上。

编程场景更能体现这种策略。在DeepSWE 1.1中,GPT-6 Sol最高推理强度得到68.8%,与Claude Fable 5 xhigh的69.9%只差1.1个百分点,但OpenAI称其单任务成本低约80%;GPT-6 Luna则达到66.6%,接近Claude Opus 5和Fable 5中等推理强度的水平,而按OpenAI测算,完成同类任务的成本分别比Opus 5低约93%、比Fable 5低约96%。Luna获得的正面评价尤其集中在性价比上,有用户惊讶于这样一个已经相当便宜的模型还能再次降价,也有人表示已开始把部分生产分类任务迁移到GPT-6 Luna。

不过,这种反馈同时暴露了GPT-6的另一面:一些开发者并未感受到很强的“6代跃迁”,原本期待Sol明显接近Astra,实际体验却更像一个更成熟、更便宜的GPT-5.6 Sol。有人干脆把这次发布概括为“主要是一次成本胜利”。

Anthropic面对的问题则完全不同。 上一代Opus 5并非能力不强,它在不少基准测试上已处于很高位置,但真实使用口碑明显分化。一些开发者认为它编程正确性不错,却容易出现表达冗长、术语奇怪、注释过多、过度设计以及擅自扩大任务范围等问题。甚至有用户指出,Opus 5在不少基准上已与Fable接近,但自己在实际编程中仍几乎全部使用Fable。

因此,Opus 5.5这次把沟通表达单独列出来并不奇怪。Anthropic强调,新模型会减少不必要的术语和特殊措辞,把重要信息放在前面,并改善长时间协作中的可读性。同时,Opus 5.5典型工作负载成本相比Opus 5下降40%,输出速度提升30%以上,Cache Read价格下降60%。这次降价,Anthropic也在试图解决“最强模型能不能重新变成开发者愿意连续使用几个小时的工具”的成本问题。

编程仍是主战场,但开发者越来越不相信几分基准差距。 在OpenAI公布的部分编程评测中,GPT-6 Sol已逼近Claude此前的高端模型。但过去几轮发布已让很多人意识到,软件工程基准里的几分差距很难稳定映射到真实使用体验。Opus 5就是一个典型例子:它发布时拥有漂亮的成绩,但仍有不少开发者认为它在真实项目里难用;与此同时,也有另一批用户认为高推理强度下的Opus 5已是非常强的程序员,甚至能根据刚发表的论文完成算法实现。

“到底好不好用”,除了模型,也越来越依赖任务类型、代码库结构、工作流以及开发者自己的Agent Harness,而不是一张统一榜单。这也是为什么Opus 5.5虽然获得了明显更积极的早期评价,社区态度仍带有很强的“先用几周再说”。一些长期在Fable、Opus和OpenAI模型之间切换的开发者已考虑把5.5重新作为主力,也有人认为其表达风格确实改善,但“基准好看”已不足以直接建立信任。Anthropic自己也承认,当模型能力达到目前水平之后,评测之间几个百分点的差距越来越难直接映射成现实体验。

原因在于,真实软件工程从来不只是“写出一段能通过测试的代码”。历史代码、技术债、架构约束、模糊需求、团队规范、长期维护性,以及“哪些地方不能碰”,都很难被单一基准完整覆盖。一个模型即使第一次写出的代码完全正确,如果它修改了大量无关文件、进行了不必要的重构,或者需要开发者花大量时间理解和返工,实际生产力仍可能低于一个跑分稍低、但行为更稳定的模型。因此,编程模型的评价对象不再是“能不能生成正确代码”,而是Agent完成一次软件工程任务的全过程质量:它用了多少步骤、改了多少无关内容、有没有理解边界、是否容易复核,以及最终需要多少人工介入。

当Agent连续工作数小时,价格战开始拼“缓存阶段”。 这次发布,OpenAI开始明显把Prompt Caching当成Agent降本的核心能力,而不再只是把它当作底层推理优化。OpenAI披露,其内部研究人员过去一年对编程Agent的使用量快速增加,如果按照API价格折算,一名研究人员每天使用编程Agent产生的Token成本中位数已超过600美元,前10%的研究人员甚至超过7000美元。当Agent开始持续运行,大量成本并非来自新的问题,而是来自同一批代码、工具定义、历史对话和任务状态被反复重新处理。

GPT-6因此进一步调整了Prompt Caching机制。已命中的缓存输入Token可获得90%的价格折扣,同时减少重复Prefill带来的计算开销和延迟。OpenAI还新增Prompt Caching Dashboard和诊断工具,让开发者看到哪些Prompt成功命中缓存、哪些没有;过去调整Reasoning Effort或动态启停工具容易让缓存失效,现在GPT-6可以在不破坏既有缓存的情况下调整推理强度,并通过保持工具定义稳定、动态控制工具可用性来提高缓存复用率,并允许开发者显式设置缓存前缀断点。数据显示,过去几个月的这些改进,已让GitHub Copilot在数十亿次OpenAI模型请求中需要重新处理的Prompt Token比例下降超过50%

这类变化也直接引起了开发者注意。一些生产Agent用户指出,自己的实际账单中,Cache Read本身就可能占据相当大比例。因此,即使一个模型普通Input Token价格便宜一半,如果缓存利用率更低,最终任务成本也未必真能便宜一半。Anthropic其实也在向同一个方向调整。Opus 5.5将Cache Read价格降低60%,并非孤立的价格变化,而是在适应同一种长周期Agent工作负载。对于长上下文编程Agent来说,缓存利用率、上下文复用和工具调用策略正在成为与模型本身同样重要的经济变量。

两家公司也都在改进使用体验。 OpenAI同时把Astra上的部分回答风格调整带到了Sol和Luna,包括减少术语堆砌、奇怪措辞和低价值细节,回答整体稍短,并在编程任务中更清楚地区分“做了什么、验证了什么、哪些事情没有验证”。这一点和Anthropic这次的方向其实非常接近,只不过Anthropic面临的是更明确的历史包袱:上一代Opus已因表达方式和工作习惯收到大量负面反馈,因此5.5更像一次有针对性的使用体验修复。

Opus 5.5目前另一个争议来自安全限制。一些早期用户报告,普通Bash操作偶尔会被判断成“Third-Party Attack”,从而阻断正常工作流。Anthropic此次进一步加入针对Agent每一步动作的分类器,并强化Prompt Injection防御。对企业Agent而言,更严格的安全防护当然有现实价值,但对编程Agent来说,现实的问题是:如果模型什么都会,却频繁因为安全系统不让做,那么能力本身就很难完全转化为生产力。

从这次同日发布可以看出,模型竞争的重心正在从“谁的API单价更低”转向“谁能让Agent在真实工作流里跑得更久、更省、更少返工”。对投资者而言,这意味着评估模型厂商的竞争力,不能只看基准分数或Token标价,还要看缓存效率、任务完成成本和开发者留存意愿——这些指标将直接影响推理算力的实际消耗节奏与AI应用层的毛利空间。