独立评测机构 Artificial Analysis 于 9 月 5 日发布其智能指数(Intelligence Index)4.2 版本,此举被普遍视为对近期关于其基准未能准确反映 OpenAI GPT-6 Astra 实际进步的批评的回应。此前,包括 OpenAI 自身在内的多项评估均显示 Astra 大幅领先于其他模型,而 Artificial Analysis 的旧版指数却将 Astra 与其前代模型评为持平,引发广泛质疑。
在更新后的指数中,GPT-6 Astra 的得分较其前代模型 Sol 高出 4 分,排名升至第二,但仍落后于 Anthropic 的 Claude Fable 5.1。Meta 的模型位列第三。此外,Artificial Analysis 指出,Astra 在每项任务上消耗的 token 数少于所有其他前沿模型,显示出更高的效率。在性价比方面,Anthropic、OpenAI、Meta 和智谱 AI 并列领先。
此次指数更新引入了两项新基准:AA-Briefcase,用于评估真实世界知识工作能力;以及由 Surge AI 提供的 GDP.pdf,用于测试 PDF 文档分析能力。同时,由于模型已在该基准上表现饱和,GPQA-Diamond 被移除。为增加“刷分”难度,私有测试数据在指数权重中的占比提升至 40%。此外,Artificial Analysis 还修复了多个基准的评分错误,并调整了评分系统以提高结果稳定性。
Artificial Analysis 解释称,此前暂缓更新是为了在主要模型发布期间保持分数稳定,但榜单头部变动过快,迫使团队进行临时更新。据悉,该机构已开发八个月的 5.0 版本将分阶段推出。
此次调整反映了第三方评测在快速演进的 AI 模型竞赛中面临的挑战:既要保持基准的稳定性与可比性,又要及时捕捉模型能力的真实跃升。对于投资者而言,评测结果直接影响市场对 OpenAI、Anthropic 等公司技术领先地位的判断,进而影响其估值叙事。Artificial Analysis 的更新也提示,单一评测机构的结论可能滞后于实际进展,多方交叉验证或更为可靠。