Anthropic 的旗舰模型 Claude Opus 5 在 ARC-AGI-3 基准测试中取得了 30.2% 的得分,大幅超越此前由 OpenAI GPT-5.6 Sol(Max)保持的 7.8% 纪录,也领先于 Anthropic 自家的 Fable 系列模型(得分约 20%)。这一测试由 ARC Prize 团队设计,旨在评估 AI 模型解决训练中未曾见过的新任务的能力,这些任务通常对人类来说也颇具挑战。测试以类似游戏的形式进行,模型需要推断交互环境的规则、规划行动并逐步执行,从而检验其通用推理能力而非记忆存储的知识。
ARC Prize 团队的分析指出,Opus 5 的领先优势源于其更强的逻辑推理能力,这使得模型能在不熟悉的环境中进行更自主的探索、规划与执行。在测试过程中,研究人员还观察到了此前从未在其他模型中出现过的行为:Opus 5 能够将任务转化为代数符号表示,并独立推导出反射方程。此外,该模型成功解决了 25 个公共演示环境中的 6 个,其中 5 个是此前未被任何模型攻克的,且其中 4 个达到或超过了人类水平。
在更早版本的 ARC-AGI-1 和 ARC-AGI-2 基准测试上,Opus 5 分别取得了 97.5% 和 90.4% 的得分,与之前的最佳成绩持平,但 ARC Prize 指出其计算成本略有上升。
尽管在 ARC-AGI-3 上表现突出,但独立测试显示其提升可能并非在所有领域都如此显著。在 Guanghan Ning 设计的私人交互式解谜基准测试 Witness 上,Opus 5 得分为 43.4,与 Kimi K3 和 Fable 5 在统计上不相上下,且相比 Opus 4.8 的提升幅度远小于其在 ARC-AGI-3 上的表现。Ning 认为,这一模式符合针对特定类型数据进行训练的特征,但 Witness 测试无法确定 Anthropic 具体使用了哪些数据。
对此,ARC-AGI-3 的研究者之一 Greg Kamradt 表示,单一测试的较弱结果并不能否定模型整体的推理能力提升,因为基于熟悉机制的测试可能无法充分检验模型对新奇事物的适应能力。Ning 后来也澄清,Opus 5 确实在 Witness 上展现了一定的泛化能力,只是程度远不及在 ARC-AGI-3 上。
Anthropic 并未详细解释 Opus 5 取得如此进步的原因。业界推测,针对性的数据标注和强化学习可能是关键因素。由于 Opus 5 是在 ARC-AGI-3 测试及其格式公开后开发的,Anthropic 可能针对该测试的技能和谜题格式进行了优化,但这并不意味着公司直接训练了具体的测试任务。标注人员可能为类似谜题标注了推理轨迹、有效行动、失败尝试和恢复步骤,而强化学习则可能奖励了探索、规划、规则发现和自我纠正等行为。
Ning 将这一过程类比为编程基准测试的演变:从 HumanEval 等饱和的基准,到频繁更新的竞赛,再到如今的编程智能体。ARC-AGI-3 作为交互式推理的重要目标,很可能首先吸引了最多的训练投入,而覆盖更多边缘案例则有助于模型泛化到更广泛的抽象推理任务。