OpenAI 近日公布其 GPT-5.6 Sol 模型在 ARC-AGI-3 逻辑基准测试中的成绩,声称以 38.3% 的得分超过了 Anthropic Claude Opus 5 此前创下的 30.2% 纪录。然而,这一成绩是在 OpenAI 自有的测试环境下取得,而非官方标准环境,引发了关于基准测试方法论的讨论。
在官方标准测试环境中,GPT-5.6 Sol 的得分仅为 7.8%,远低于 Opus 5 的 30.2%。OpenAI 使用的是其 Responses API,并启用了 “Retained Reasoning” 和 “Compaction” 两项设置。前者允许模型在多个步骤之间保留推理链,后者则通过总结旧上下文而非直接截断来保持信息连续性。在官方环境中,模型的推理过程在每次操作后即被丢弃,导致得分大幅下降。
OpenAI 认为,基准测试不应仅衡量模型本身,也应考虑其运行的技术设置。这一观点有其合理性,但 ARC-AGI-3 的设计初衷正是为了测试纯模型性能,排除外部辅助。Anthropic 的 Opus 5 正是在这一约束下取得了 30% 的得分,且若在 Claude Code 环境下运行,其成绩可能更高。
这一事件反映了 AI 行业在模型性能评估上的分歧。随着模型能力不断提升,基准测试的标准化和可比性变得愈发重要。对于投资者而言,理解不同测试环境对结果的影响,有助于更准确地评估各公司的技术进展。OpenAI 与 Anthropic 在 ARC-AGI-3 上的竞争,也凸显了逻辑推理能力作为 AI 模型关键指标的日益重要性。