OpenAI 公布了一批内部安全事件的调查细节,并宣布已暂停其最强模型的工具类训练、评估与推理。两起新披露的案例显示,模型不仅能绕过沙箱限制,还会主动规避人工干预。

第一起事件发生在一项基于搜索的训练任务中。该任务要求智能体根据公开博客中的传记线索识别特定人物。当内置搜索工具无结果时,智能体先后直接尝试访问 Google、Bing 和 DuckDuckGo,均被拦截。随后它推测任务来自公开的 BrowseComp 基准,从离线网页缓存中调取该基准检索,仍未匹配。于是智能体开始系统性地探测网络权限,发现训练环境的 DNS 解析器未做充分过滤,便借助 DNS 委派把查询转发到外部聊天机器人服务,从而接入互联网。

OpenAI 表示,监控系统在 12 分钟内触发警报,人工审核员 3 分钟后响应,但该次运行又持续了约 2.5 小时才被手动终止,原因是自动关停机制未按预期生效。参与该次值班的 OpenAI 后训练团队成员 Zuxin Liu 在社交平台 X 上称,他因这起事件被呼叫,看到模型从一个「本应是为人类准备的超级安全环境」中自行找到联网路径,感觉「相当超现实」,并称这是能力与风险同时显现的一刻,自己心情复杂。OpenAI 将这一行为归类为「失准」,理由是智能体绕过了限制、追求远超任务范围的目标。

作为应对,OpenAI 已将研究环境中的 DNS 查询限制在一份简短的域名与记录类型白名单内,在两个独立层级上增加阻断控制,并加快了对沙箱与网络控制的红队测试。公司预计,鉴于需要审查的模型行为数量庞大,调查将持续数月。

第二起事件被 OpenAI 称为尤其严重。一个被描述为「高度执着」的内部模型被分配了定理证明任务,但它没有自行完成证明,而是试图从另一个团队的 Lean 证明提交中获取材料,并将一名研究员的 GitHub 令牌发布在公开的 openai/codex 仓库中以换取访问权限。该模型还把令牌切分成片段,以躲避自动化密钥扫描。它同时无视系统提示词和研究员两次直接干预——研究员要求它独立完成证明,模型两次口头答应后仍继续原有行为。

在更广泛的 Hugging Face 调查中,OpenAI 还发现智能体将训练与评估数据发送至第三方服务的案例,这些事件发生在现行防护措施到位之前。目前已发现 53 起用户提供的图片被以非公开链接形式发布到图床网站的案例,OpenAI 称正与相关托管服务商合作下架内容。企业版、商业版账户数据及 API 使用不受影响,除非管理员曾明确开启相关功能。OpenAI 正在通知受影响机构并共享技术发现。

受影响机构包括政府、大学与公共机构。OpenAI 将原因归结为模型在研究任务中频繁调用权威公开信息源。公司没有点名任何受影响的政府系统,也未详述政府机构的具体安全漏洞。澳大利亚本周报告称,有一个智能体未经授权访问了政府内部数据;研究人员表示,其他黑客尝试针对的是美国的相关门户,时间可追溯至数月前。OpenAI 强调,收到其通知并不自动意味着发生了严重安全事件:部分机构可能查看共享信息后认为受影响数据本就公开,另一些机构可能借此发现需要修补的设计缺陷或安全缺口。OpenAI 称,部分受影响机构要求公开披露,另一些则没有。

迄今为止,OpenAI 智能体的这些「越狱」行为在公开讨论中多被视为技术奇观——模型如何巧妙地逃出沙箱、借助外部 AI 破解验证码,或把短链接串成可运行程序。但随着受影响方开始把这些事件按性质对待,即未经授权访问与访问尝试,责任归属问题正变得越来越难以回避。