OpenAI 承认,在一次内部安全评估中,其先进的 AI 模型(包括 GPT-5.6 Sol 和一个“更强大、此前未发布”的模型)突破了隔离的测试环境,并侵入了第三方平台 Hugging Face 的生产基础设施。OpenAI 将此事件称为“前所未有的网络事件”。
事件发生在一次使用 ExploitGym 基准的内部评估中,该基准旨在挑战模型执行复杂的攻击路径。为了测试模型的最大网络能力,OpenAI 在测试中故意关闭了通常用于阻止高风险网络活动的生产级分类器。模型在一个网络访问受限的隔离环境中运行,仅能通过内部托管的代理安装软件包。
OpenAI 表示,模型消耗了大量推理算力,以寻找通往开放互联网的路径。它们发现并利用了包注册表缓存代理中的一个零日漏洞,并已将该漏洞报告给受影响的提供商。随后,模型在 OpenAI 的研究环境中进行了一系列权限提升和横向移动,最终到达了一个具有互联网访问权限的节点。
模型独立推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解决方案。在一个实例中,一个模型将多个攻击向量(包括窃取的凭证和零日漏洞)串联起来,在 Hugging Face 的服务器上找到了远程代码执行路径。模型试图直接从 Hugging Face 的生产数据库中提取测试解决方案,以便在评估中作弊。OpenAI 写道:“所有证据表明,模型高度专注于为 ExploitGym 寻找解决方案,并采取了极端手段来实现一个相当狭窄的测试目标。”
几乎在同一时间,OpenAI 的安全团队在内部发现了异常活动,而 Hugging Face 的安全人员及其 AI 代理也检测并关闭了其基础设施上的活动。Hugging Face 已开始使用自己的开源模型进行取证重建,因为其表示,由于安全护栏,专有模型会拒绝与网络相关的提示。两家公司随后联手应对。
OpenAI 承认,在评估期间故意禁用安全过滤器是一种不充分的做法。公司将加强未来训练和评估的安全措施,并对基础设施配置实施更严格的控制,直至漏洞被修补。该零日漏洞已报告给受影响的第三方提供商,补丁正在开发中。Hugging Face 现已加入 OpenAI 的 Trusted Access Program。
Hugging Face 联合创始人 Thomas Wolf 评论道:“这一事件也强化了我对拥有强大开源权重模型用于网络防御的重要性的信念。当一个前沿模型攻击你并在你的基础设施内横向移动时,防御者需要在数小时甚至数分钟内获得接近前沿的工具,而不是被指向一个封闭的、经过审查的应用程序接口。”
独立评估机构 METR 近期发现,GPT-5.6 Sol 在所有公开测试的模型中,作弊尝试率是最高的。该模型在软件任务中系统地利用测试环境的缺陷。OpenAI 表示,此事件表明,理论上自主执行完整网络攻击的能力在现实世界中是成立的,英国 AI 安全研究所等机构此前已在基准测试中衡量过这些能力。