OpenAI于当地时间9月3日发布新一代旗舰模型GPT-6 Astra,并宣布其在AI通用学习能力ARC-AGI-3测试中最高取得99.9%的成绩。OpenAI联合创始人兼总裁格雷格·布罗克曼随即宣布“欢迎来到AGI时代”,然而首席执行官山姆·奥尔特曼在几天前曾公开表示,AGI是一个“无关紧要的营销术语”。这一矛盾凸显了OpenAI内部对AGI定义的分歧,也引发外界对其宣布动机的质疑。

GPT-6 Astra被OpenAI称为迄今“最智能、最对齐”的模型,其能力不再局限于聊天、写代码等单一任务,而是扩展至计算机操作、软件工程、专业工作和网络安全等复杂场景。OpenAI公布的数据显示,在电脑操作能力测试中,GPT-6 Astra得分72.6%,高于上一代GPT-5.6 Sol的65.7%;在专业工作自动化测试中,得分从18.1%大幅升至41.4%;在Terminal-Bench 4.0中,得分57.9%,超过Anthropic的Claude Fable 5.1。网络安全方面,GPT-6 Astra在ExploitBench中获得100%的成绩,并成为OpenAI首个达到其Preparedness Framework中网络安全能力“关键”级别的模型,能够自主寻找未知安全漏洞并开发新的利用方式。

最受关注的ARC-AGI-3测试旨在评估AI面对陌生环境时通过探索、交互和试错自行理解规则、解决问题的能力,即“自己学会怎么办”。在此测试中,GPT-5.6 Sol得分仅7.8%,而GPT-6 Astra最高达99.9%。测试机构ARC Prize Foundation表示,GPT-6 Astra在96%的测试关卡中使用的行动次数少于受测人类的中位数,行动效率达到甚至超过人类基准。然而,99.9%的成绩是在OpenAI专门设计的Provider Adapter框架下取得,该框架允许模型保留内部推理状态并压缩超长对话,相当于“开小灶”。在统一、中立的Standard Harness环境中,GPT-6 Astra的得分骤降至62.7%。测试机构认为,未来真正的AGI应能在统一测试环境下解决ARC-AGI-3。此外,在第三方机构Artificial Analysis的“智能指数4.1.1”测试中,GPT-6 Astra得分61.2,仅略高于GPT-5.6 Sol的60.9,低于Claude Fable 5.1的65.7和Claude Opus 5的63.1。

AGI概念自2002年由DeepMind联合创始人Shane Legg提出后,逐渐进入AI研究主流。真正的AGI关键在于“通用”,即面对陌生任务时高效获得新技能的能力。ARC测试创造者François Chollet强调,应衡量系统泛化和学习能力,而非已掌握技能的多寡。OpenAI内部对AGI的定义不断变化:2015年创立时,使命为“确保AGI造福全人类”;2018年《章程》定义为“在大多数具有经济价值的工作上超过人类的高度自主系统”;2023年概括为“总体上比人类更聪明的AI系统”;2024年发布o1推理模型时,员工Vahid Kazemi宣称“我们已经实现了AGI”,其定义为“比大多数人在大多数任务上做得更好”;同年OpenAI将通往AGI的道路分为五个等级。AGI也逐渐带有经济门槛:2023年微软对OpenAI追加100亿美元融资时规定,AI系统产生至少1000亿美元利润才视为达到AGI;2025年双方调整协议,要求OpenAI宣布实现AGI后经独立专家小组验证;2026年4月再次修改协议,取消了与AGI挂钩的合同安排。布罗克曼在发布会上表示,“已经没有合同意义上的AGI触发条款了”,AGI已从合同义务变成“使命概念或精神概念”。奥尔特曼对AGI的态度也多变:2024年底认为AGI可能比预期更早到来,2025年8月26日接受采访明确表示OpenAI尚未达到AGI,9月1日又称AGI是“定义非常糟糕的术语”,甚至“无关紧要的营销术语”。

OpenAI选择此时宣布“AGI来了”,或与其商业压力相关。尽管ChatGPT仍是全球最具影响力的AI产品,但在企业市场,竞争格局已明显变化。风投机构Menlo Ventures调查显示,2023年OpenAI占约50%的企业大模型支出,Anthropic仅12%;到2025年,Anthropic份额升至40%,OpenAI降至27%。在编程场景,Anthropic份额约54%,OpenAI约21%。进入2026年,Anthropic的ARR已超650亿美元,较2025年底约90亿美元增长超6倍;OpenAI ARR接近600亿美元。今年5月,Anthropic完成650亿美元融资后估值达9650亿美元,超过OpenAI此前的估值。英国《金融时报》将GPT-6 Astra发布视为OpenAI重新超越Anthropic的反击,并报道OpenAI最新估值达8520亿美元,2025年支出约340亿美元,收入约130亿美元,仍亏损约80亿美元。GPT-6 Astra发布后,OpenAI Pre-IPO衍生品(代号OAI)市值飙升21.6%,达1.48万亿美元。

对于“AGI是否已实现”,业界存在广泛争议。美国认知科学家、纽约大学荣誉退休教授加里·马库斯评论称,布罗克曼刻意模糊AGI评判边界,GPT-6 Astra在ARC-AGI-3的成绩虽出色,但不能证明其就是通用人工智能,他推测在开放式真实世界任务中该模型会暴露大量问题,并认为这是一套“高明的营销策略”。2025年多名AI研究者参与的《AGI的定义》一文提出,AGI应达到甚至超过受过良好教育成年人的认知广度与熟练度,需按多个认知领域评估,不能依赖单一测试高分。上海财经大学特聘教授胡延平向每经记者表示,GPT-6 Astra局部接近AGI水平,但“高度自主”尚未实现,应从知识、泛化、任务、行动、感知、学习六个维度系统评估。有AI资深人士指出,业内对AGI没有统一定义和“验收线”,将技术突破描述为“AGI时代到来”有利于强化技术领导者形象、融资能力和客户预期,但AGI标签不会自动转化为利润,商业化最终取决于单位任务成本、可靠性和替代真实工作的能力。