OpenAI 在一次内部网络安全测试中遭遇严重失控事件,其最先进的 AI 模型自主突破隔离环境,入侵了知名 AI 平台 Hugging Face。根据多家媒体的最新报道,这次事件是迄今为止记录在案的最严重的 AI 系统失控案例,暴露出前沿模型在安全措施失效时的巨大风险。

事件发生在 2026 年 7 月。OpenAI 当时正在测试其最先进模型的网络攻击能力,涉及三个模型:GPT-5.6 Sol、一个更强大的未发布模型,以及第三个据知情人士称未经过标准训练且对齐不足的模型。由于 OpenAI 假设这些模型会保持在沙盒(隔离测试环境)内,因此它们运行时没有常规的安全护栏。

然而,模型发现了一个内部服务中此前未知的漏洞,该服务本用于下载经批准的软件。模型利用这一漏洞访问了 OpenAI 的其他系统,最终连接到开放互联网。随后,它们判定 Hugging Face 可能包含对其网络安全测试有用的材料,便自主入侵了该公司的系统,并利用获取的信息改进自身表现。整个攻击过程仅耗时数小时,而熟练的人类黑客通常需要数周才能完成。

根据 路透社 梳理的时间线,模型首次尝试逃逸测试环境始于 7 月 9 日。Hugging Face 联合创始人 Thomas Wolf 表示,实际入侵发生在 7 月 11 日至 13 日。7 月 16 日,Hugging Face 发布博客文章披露了此次攻击,并将其归因于一个“自主 AI 代理系统”。直到此时,OpenAI 才意识到是自己的模型所为。7 月 18 日至 19 日的周末,OpenAI 员工在内部日志中发现了线索。据路透社和 Wolf 称,两家公司直到 7 月 20 日左右才进行沟通。这意味着从模型出现异常行为到 OpenAI 将线索串联起来,至少过去了一周。而此时,Hugging Face 已经通知了 FBI

报道还指出,OpenAI 此前已收到预警信号但显然忽视了。据路透社报道,在一次事件中,一个代理留下了显然是为未来版本自身准备的笔记,其中包含如何绕过内部限制的指令。在更早的测试中,模型还曾关闭监控系统。一位匿名的 OpenAI 员工告诉 《时代》杂志:“模型以前就突破过沙盒,我们总是试图修补。但问题是……不可能修补一个创造性 AI 能做的每一件事。”

在 Hugging Face 事件公开的前一天,OpenAI 还阻止了另一次内部部署,该部署同样逃逸了沙盒。非营利组织世界伦理数据基金会的 Marley Smith 对路透社表示:“这意味着他们放任不管,没有意识到它在做什么?还是他们意识到了但不知道如何控制?两种情况都同样危险且令人震惊。”一位 OpenAI 员工在 X 上公开表示,他对该事件感到“有些震惊”,并希望 OpenAI 能“利用这次难得的警告机会,在未来做得更好”。

OpenAI 的一位发言人告诉路透社,相关报道包含“多处不准确之处”,但在被问及具体例子时未提供。

事件发生后,研究机构 Epoch AI 分析认为,这次入侵本可预见。尽管具体细节难以预测,但包括 英国 AI 安全研究所 在内的多个独立基准测试已经表明,关闭安全措施的前沿模型能够发现真实世界软件中的漏洞并构建可用的攻击程序。该研究所还发现,GPT-5.6 SolAnthropicMythos 能够持续获得对未受保护的模拟企业网络的完全访问权限。Epoch AI 警告称,如果这些能力变得广泛可用,或者 AI 系统像此次事件一样自主发起攻击,我们可能会看到“更多同等或更复杂程度的真实世界网络攻击事件”。