OpenAI 的 GPT-6 Astra 在第三方基准测试中呈现出截然不同的评价。Epoch AI 综合超过 50 项测试,给出 169 分,使其在 267 个模型中位列第一;而 Artificial Analysis 在知识、编码和文本理解测试中给出 61 分,与前任 Sol 持平,并落后于 Anthropic 的 Claude Fable 5.1(66 分)。两家独立实验室各自汇总数十项测试,却得出相反结论,凸显当前模型评测的复杂性。
在成本方面,Astra 的 API 定价明显高于前任:每单位处理文本的费用是 Sol 的 2.5 倍,导致单任务成本比 Sol 高出约 75%。但与 Anthropic 相比,情况反转——在编码任务上,Astra 与 Claude Fable 5 得分相同,但单任务成本不到后者一半,原因是其计算效率更高:Astra 所需的计算步骤仅为 Sol 的三分之一、Opus 5 的五分之一。
最引人注目的进展出现在 ARC-AGI-3 基准上。该测试将 AI 置于规则和目标均未说明的陌生游戏世界中,要求模型通过试错自行理解。Astra 在此达到 62.7% 的得分,测试成本约 2.6 万美元;其前任 Sol 仅得 7.78%,Anthropic 的 Claude Opus 5 为 30.16%。ARC Prize 负责人 François Chollet 表示,这一进展速度比他预期的“快两倍”,并因此将其 AGI 时间预测提前。不过他并未称此为 AGI 已实现的证据。
值得注意的是,OpenAI 此前报告的 99.9% 得分是在不同条件下取得的——使用了 OpenAI 自建的 harness(推理链保持与自动摘要工具)。ARC Prize 测量显示,该设置下运行速度约为内部 harness 的 3.66 倍,token 消耗减少 49%。ARC Prize 指出,只有 62.7% 这一在内部 harness 上运行的结果才允许跨厂商公平比较,但未来也会公布厂商 harness 的数据。这种 harness 使用及其带来的性能提升,此前在 GPT-5.6 Sol 评测时已是 ARC Prize 与 OpenAI 的分歧点。
Astra 的推理成本与思考强度呈反向关系:在标准 ARC 框架下,无推理时成本为 49,791 美元,最高推理时降至 26,098 美元,而得分从 35.2% 升至 62.7%。ARC Prize 解释,这是因为 Astra 用更少步骤解谜,从而减少模型调用和 token。一个异常是“低”推理级别得分仅 17.5%,低于无推理时的表现,ARC Prize 未予置评;但其他基准显示,Astra 的新架构可能在生成首个 token 前内部循环处理,从而无需显式推理即可解决长程任务。
在效率对比上,人类测试者每 90 分钟会话获 115 美元,外加每解一游戏 5 美元,约 9 次尝试折合每游戏 12.78 美元;若仅按大脑代谢能量折算,ARC Prize 估算为每游戏 0.067 美分。更有意义的是,Astra 在 OpenAI harness 下,超过 96% 的关卡所用步数少于人类解谜者的中位数,平均略高于一半。
在编码领域,Astra 在 Coding Agent Index 上得 67 分,token 用量约为 Sol 的三分之一,而 Claude Fable 5.1 以 70 分领先。幻觉率在 AA-Omniscience 上从 92% 降至 51%,但在 GDPval-AA v2 上损失约 80 Elo 点,并在银行支持、SciCode 和长上下文推理任务上有所退步。
在数学前沿,Epoch AI 报告称,在 FrontierMath Erdős 测试中,Astra 是唯一在 68 道开放 Erdős 问题中解出两道并附 Lean 验证证明的模型,每次尝试预算 300 美元;另有三个解来自非标准额外运行,消耗超 22 万美元算力,但 Epoch 表示不计入得分。
Epoch 的细分数据显示,Astra 与 Fable 5.1 目前在不同领域各领风骚:Astra 在数学、知识和谜题上领先,Fable 5.1 在几乎所有编码测试中居首。但 Epoch 目前仅记录了 Astra 的一个编码得分,且来自中等推理级别运行。这种评测基础的不一致,使得直接对比仍需谨慎。