OpenAI 的旗舰模型 GPT-6 Astra 近日再度成为市场焦点。据外媒整理,这款模型的训练规模约达 10 万颗 GPU,推估成本可能高达 5 亿至 10 亿美元;若后续训练规模进一步扩大,成本纪录仍可能再被刷新。
NVIDIA 首席执行官 黄仁勋 近期也表示,GPT-6 Astra 象征人工通用智能(AGI)时代的来临。不过,尽管 OpenAI 对 Astra 的能力相当乐观,最新比较结果显示,Anthropic 的 Claude Fable 5.1 仍在多项关键测试中保持领先。
汇总评测指出,Fable 5.1 在 SWE-bench Pro、Artificial Analysis 的 Intelligence Index、Coding Agent Index 以及 ProofBench v1.1 等项目中仍优于 Astra。另一方面,Astra 在部分任务上展现出较佳的成本效率与速度,尤其在代理式工作流程与 token 使用效率方面,受到开发者关注。
双方在 API 定价上看似相近,输入与输出 token 的标价分别为每百万 token 10 美元与 50 美元,但实际成本并不完全相同。数据显示,Astra 的平均任务成本约为 2.57 美元,而 Fable 5.1 约为 6.12 美元;在某些高推理强度的编码任务中,Astra 也被认为更省时、成本更低。
不过,Fable 5.1 也通过降低缓存读取费用,强化了长上下文与重度代理工作负载的成本优势。整体来看,这场新一代旗舰模型之争,已从单纯比拼能力,延伸到训练规模、推理效率与实际使用成本的全面竞赛。
值得注意的是,Astra 在 AI 编码性能上取得了 67 分 的高分,展现出卓越的 token 效率,但仍不及 Fable 5.1。这一对比凸显了不同模型在特定任务上的差异化优势,也为开发者选择模型提供了更多考量维度。
随着模型能力接近 AGI 门槛,业界对模型评估的维度也在扩展,从单纯的基准测试成绩,到实际任务中的成本与效率,都将影响未来 AI 应用的部署选择。