獨立評測機構 Artificial Analysis 於 9 月 5 日釋出其智慧指數(Intelligence Index)4.2 版本,此舉被普遍視為對近期關於其基準未能準確反映 OpenAI GPT-6 Astra 實際進步的批評的回應。此前,包括 OpenAI 自身在內的多項評估均顯示 Astra 大幅領先於其他模型,而 Artificial Analysis 的舊版指數卻將 Astra 與其前代模型評為持平,引發廣泛質疑。
在更新後的指數中,GPT-6 Astra 的得分較其前代模型 Sol 高出 4 分,排名升至第二,但仍落後於 Anthropic 的 Claude Fable 5.1。Meta 的模型位列第三。此外,Artificial Analysis 指出,Astra 在每項任務上消耗的 token 數少於所有其他前沿模型,顯示出更高的效率。在價效比方面,Anthropic、OpenAI、Meta 和智譜 AI 並列領先。
此次指數更新引入了兩項新基準:AA-Briefcase,用於評估真實世界知識工作能力;以及由 Surge AI 提供的 GDP.pdf,用於測試 PDF 文件分析能力。同時,由於模型已在該基準上表現飽和,GPQA-Diamond 被移除。為增加“刷分”難度,私有測試資料在指數權重中的佔比提升至 40%。此外,Artificial Analysis 還修復了多個基準的評分錯誤,並調整了評分系統以提高結果穩定性。
Artificial Analysis 解釋稱,此前暫緩更新是為了在主要模型釋出期間保持分數穩定,但榜單頭部變動過快,迫使團隊進行臨時更新。據悉,該機構已開發八個月的 5.0 版本將分階段推出。
此次調整反映了第三方評測在快速演進的 AI 模型競賽中面臨的挑戰:既要保持基準的穩定性與可比性,又要及時捕捉模型能力的真實躍升。對於投資者而言,評測結果直接影響市場對 OpenAI、Anthropic 等公司技術領先地位的判斷,進而影響其估值敘事。Artificial Analysis 的更新也提示,單一評測機構的結論可能滯後於實際進展,多方交叉驗證或更為可靠。