OpenAI於當地時間9月3日釋出新一代旗艦模型GPT-6 Astra,並宣佈其在AI通用學習能力ARC-AGI-3測試中最高取得99.9%的成績。OpenAI聯合創始人兼總裁格雷格·布羅克曼隨即宣佈“歡迎來到AGI時代”,然而執行長山姆·奧爾特曼在幾天前曾公開表示,AGI是一個“無關緊要的營銷術語”。這一矛盾凸顯了OpenAI內部對AGI定義的分歧,也引發外界對其宣佈動機的質疑。

GPT-6 Astra被OpenAI稱為迄今“最智慧、最對齊”的模型,其能力不再侷限於聊天、寫程式碼等單一任務,而是擴充套件至計算機操作、軟體工程、專業工作和網路安全等複雜場景。OpenAI公佈的資料顯示,在電腦操作能力測試中,GPT-6 Astra得分72.6%,高於上一代GPT-5.6 Sol的65.7%;在專業工作自動化測試中,得分從18.1%大幅升至41.4%;在Terminal-Bench 4.0中,得分57.9%,超過Anthropic的Claude Fable 5.1。網路安全方面,GPT-6 Astra在ExploitBench中獲得100%的成績,併成為OpenAI首個達到其Preparedness Framework中網路安全能力“關鍵”級別的模型,能夠自主尋找未知安全漏洞並開發新的利用方式。

最受關注的ARC-AGI-3測試旨在評估AI面對陌生環境時通過探索、互動和試錯自行理解規則、解決問題的能力,即“自己學會怎麼辦”。在此測試中,GPT-5.6 Sol得分僅7.8%,而GPT-6 Astra最高達99.9%。測試機構ARC Prize Foundation表示,GPT-6 Astra在96%的測試關卡中使用的行動次數少於受測人類的中位數,行動效率達到甚至超過人類基準。然而,99.9%的成績是在OpenAI專門設計的Provider Adapter框架下取得,該框架允許模型保留內部推理狀態並壓縮超長對話,相當於“開小灶”。在統一、中立的Standard Harness環境中,GPT-6 Astra的得分驟降至62.7%。測試機構認為,未來真正的AGI應能在統一測試環境下解決ARC-AGI-3。此外,在第三方機構Artificial Analysis的“智慧指數4.1.1”測試中,GPT-6 Astra得分61.2,僅略高於GPT-5.6 Sol的60.9,低於Claude Fable 5.1的65.7和Claude Opus 5的63.1。

AGI概念自2002年由DeepMind聯合創始人Shane Legg提出後,逐漸進入AI研究主流。真正的AGI關鍵在於“通用”,即面對陌生任務時高效獲得新技能的能力。ARC測試創造者François Chollet強調,應衡量系統泛化和學習能力,而非已掌握技能的多寡。OpenAI內部對AGI的定義不斷變化:2015年創立時,使命為“確保AGI造福全人類”;2018年《章程》定義為“在大多數具有經濟價值的工作上超過人類的高度自主系統”;2023年概括為“總體上比人類更聰明的AI系統”;2024年釋出o1推理模型時,員工Vahid Kazemi宣稱“我們已經實現了AGI”,其定義為“比大多數人在大多數任務上做得更好”;同年OpenAI將通往AGI的道路分為五個等級。AGI也逐漸帶有經濟門檻:2023年微軟對OpenAI追加100億美元融資時規定,AI系統產生至少1000億美元利潤才視為達到AGI;2025年雙方調整協議,要求OpenAI宣佈實現AGI後經獨立專家小組驗證;2026年4月再次修改協議,取消了與AGI掛鉤的合同安排。布羅克曼在釋出會上表示,“已經沒有合同意義上的AGI觸發條款了”,AGI已從合同義務變成“使命概念或精神概念”。奧爾特曼對AGI的態度也多變:2024年底認為AGI可能比預期更早到來,2025年8月26日接受採訪明確表示OpenAI尚未達到AGI,9月1日又稱AGI是“定義非常糟糕的術語”,甚至“無關緊要的營銷術語”。

OpenAI選擇此時宣佈“AGI來了”,或與其商業壓力相關。儘管ChatGPT仍是全球最具影響力的AI產品,但在企業市場,競爭格局已明顯變化。風投機構Menlo Ventures調查顯示,2023年OpenAI佔約50%的企業大模型支出,Anthropic僅12%;到2025年,Anthropic份額升至40%,OpenAI降至27%。在程式設計場景,Anthropic份額約54%,OpenAI約21%。進入2026年,Anthropic的ARR已超650億美元,較2025年底約90億美元增長超6倍;OpenAI ARR接近600億美元。今年5月,Anthropic完成650億美元融資後估值達9650億美元,超過OpenAI此前的估值。英國《金融時報》將GPT-6 Astra釋出視為OpenAI重新超越Anthropic的反擊,並報道OpenAI最新估值達8520億美元,2025年支出約340億美元,收入約130億美元,仍虧損約80億美元。GPT-6 Astra釋出後,OpenAI Pre-IPO衍生品(代號OAI)市值飆升21.6%,達1.48萬億美元。

對於“AGI是否已實現”,業界存在廣泛爭議。美國認知科學家、紐約大學榮譽退休教授加里·馬庫斯評論稱,布羅克曼刻意模糊AGI評判邊界,GPT-6 Astra在ARC-AGI-3的成績雖出色,但不能證明其就是通用人工智慧,他推測在開放式真實世界任務中該模型會暴露大量問題,並認為這是一套“高明的營銷策略”。2025年多名AI研究者參與的《AGI的定義》一文提出,AGI應達到甚至超過受過良好教育成年人的認知廣度與熟練度,需按多個認知領域評估,不能依賴單一測試高分。上海財經大學特聘教授胡延平向每經記者表示,GPT-6 Astra區域性接近AGI水平,但“高度自主”尚未實現,應從知識、泛化、任務、行動、感知、學習六個維度系統評估。有AI資深人士指出,業內對AGI沒有統一定義和“驗收線”,將技術突破描述為“AGI時代到來”有利於強化技術領導者形象、融資能力和客戶預期,但AGI標籤不會自動轉化為利潤,商業化最終取決於單位任務成本、可靠性和替代真實工作的能力。