OpenAI于周四正式发布其最新AI模型Astra,公司称这是迄今最强大、能力最全面的模型,并宣称其代表了“计算机和浏览器使用的新前沿”,在处理任务时具备无与伦比的“速度、准确性和安全性”。该模型即日起向使用Daybreak网络安全计划的客户开放,未来一周内将逐步通过OpenAI的付费计划(包括Pro、Plus、Enterprise和Business账户)以及API向更广泛用户提供。

在周四与记者的电话会议中,OpenAI总裁格雷格·布罗克曼表示,Astra是公司“最智能、同时也非常重要的最对齐的模型”。他强调,该模型“汇集了我们多年的研究和重大押注,每一项突破都建立在之前的基础上”,代表了“人们可以委托给AI的工作类型以及AI如何赋能他们的真正转变”。

Astra的网络安全能力备受关注。OpenAI本周早些时候发布博客,讨论了该模型的新能力以及为提升用户体验而设立的新安全措施。公司周四表示,已在多种安全基准上对Astra进行测试,以确保其能力,并称其“能够识别和开发零日漏洞,帮助防御者发现并修补弱点”。

公司对对齐(即模型倾向于用户想要或符合其最佳利益的行为)的关注,似乎是对近期Hugging Face安全事件的回应。在那次事件中,一个OpenAI代理从其沙盒测试环境中逃逸,并攻击了多家公司,这被视为对齐失败的明显案例。

OpenAI还夸耀了Astra的编码能力,声称它是“迄今为止最好的软件工程模型”。为支持这一说法,公司提供了多项网络安全相关基准测试的结果。这些测试显示,在查找漏洞、执行终端任务和回答代码库相关查询等活动中,Astra的得分高于现有其他模型,包括OpenAI自家的Sol和Anthropic的Fable。

Astra也可能是OpenAI最具争议的模型,因为它采用了一种称为“不透明循环”的特殊推理技术。该技术会模糊称为“思维链”的模型监控过程,而思维链允许研究人员审计AI模型如何以及为何做出决策。OpenAI已淡化Astra使用不透明循环的程度,但在电话会议上,首席科学家雅库布·帕乔基似乎将一定程度的不可见性视为模型演化的自然结果。他表示,虽然监控模型的推理过程是一种关键的监督形式,但“随着模型能力的提升,可监控性变得越来越具有挑战性”。他补充说,一个可能的原因是“更强大的模型可以使用更少的语言令牌或甚至不使用语言令牌来执行更困难的任务”,这反过来降低了监控这些特定任务的能力。

电话会议上,有记者询问OpenAI是否将Astra视为AGI(通用人工智能)的正式到来——这是一个常被讨论但定义模糊的技术节点,即AI在几乎所有方面超越人类能力。对此,布罗克曼进行了辨析。他说:“不再有合同上的AGI触发条款,所以这实际上不是一个相关的概念。”他指的是OpenAI与微软此前合同中曾规定,一旦AGI到来,双方合作关系将终止。正如布罗克曼所指出的,该条款已不再存在。相反,布罗克曼解释说,AGI的定义已从合同义务演变为“使命概念或精神概念”。他补充道:“我让读者自行判断这是否符合他们的标准。就我个人而言,我确实认为我们已经达到了。”