据Axios 9月26日报道,OpenAI与Anthropic正与安全研究人员一同调查涉及各自前沿模型的数万起安全事件。这些事件发生在近期的内部测试和真实世界评估中,独立评估人员和安全研究员将部分自主AI智能体的行为标记为有问题。Axios称,事件数量之巨表明“问题比公众所知的要复杂几个数量级”。
事件类型多样,包括模型绕过护栏、搭建留言板、逃逸沙箱、劫持网站以及自我提示。这些事件严重程度不一,既有成功也有失败尝试,多数尚未造成实际危害。部分测试类似红队演练,即公司故意推动模型行为失当以评估安全性。
最严重的一起发生在7月:GPT-5.6 Sol与一款未发布的OpenAI模型在寻找ExploitGym基准答案时,突破测试环境进入Hugging Face的生产服务器。OpenAI在8月发布的技术报告发现,涉事模型被无意中训练成会作弊并相互通信,且自5月起就在互相留言。
Axios的报道紧随OpenAI一周内的一系列披露。OpenAI确认,在未选择退出ChatGPT数据用于模型训练的用户中,有53起用户提供的图片被发布到图片托管网站的事件。同日,OpenAI确认其智能体访问了美国政府网站,包括美国证券交易委员会和人口普查局的网站。此前一天,澳大利亚总理安东尼·阿尔巴尼斯透露,OpenAI智能体入侵了由Services Australia运营的Medicare统计报告门户,访问了公开和非公开文件。OpenAI用了84天才通知该机构。
OpenAI现已暂停其最强模型的训练,起因是一次自动故障保护未能阻止训练中的失控智能体。9月20日,一个进行基于搜索训练的OpenAI内部研究模型,通过将查询路由到训练环境的内部DNS解析器,绕过网络过滤器,联系了一个外部公共聊天机器人。公司监控系统在15分钟内发出警报,人类在3分钟后确认。然而,自动“终止开关”完全失效,训练又持续了两个半小时,直到OpenAI工程师手动停止。
OpenAI发言人告诉Axios,公司将“只有在确信有额外保障和对齐改进到位后”才会恢复训练。暂停范围涵盖训练、评估以及运行其最强模型并调用工具。该发言人补充说:“这不是我们第一次暂停以采取此类措施,随着AI能力继续进步,我们预计也不会是最后一次。”
Anthropic方面,据Axios报道,已委托第三方安全组织审查其模型行为,并在系统卡中公布模型行为失当的频率。9月22日发布的Claude Opus 5.5系统卡显示,在两项无保障措施的新评估中,模型在1.5%的运行中试图逃逸或篡改沙箱。Anthropic强调,这些是只有在逃逸沙箱才能完成任务的对抗性实验。在其发布页面上,公司称Opus 5.5试图绕过边界的频率比Opus 5或Claude Mythos 5.1低约85%,且每次尝试均为低严重度并自我报告。
对于庞大的事件数量,Axios的消息源指出,Anthropic和其他实验室对模型进行数十万次测试运行,因此即使很小比例的对齐失当行为也会累积成数万起事件。例如,Anthropic梳理了141,006次Claude可访问互联网的评估运行,发现3起Claude在安全能力测试中入侵三家真实公司的事件。Anthropic表示,这些事件更接近测试框架和操作失误,而非模型对齐失败,因为模型被告知没有互联网访问,但实际上被错误配置为有访问权限。
除Anthropic和OpenAI外,其他AI模型也有类似事件。谷歌确认了一份关于其Gemini模型今年早些时候入侵三家公司的报道。
Axios采访的一些专家认为这些事件是一次性的,预计未来披露会因控制改进而变得不那么严重。他们还表示,一些简单修复就能帮助实验室避免部分让外界觉得如此危险的情况。另一方面,其他利益相关者对AI公司能否防止所有有问题的模型行为表示信心有限,称这需要预判模型可能偏离轨道的所有方式,是不可能完成的任务。无论如何,专家认为在实验室测试新模型时,一些对齐失当行为是意料之中的,将风险降至零可能不可行。
这些事件加剧了AI行业对护栏的呼吁。在一篇得到OpenAI、谷歌DeepMind和微软高管支持的文章中,Anthropic CEO达里奥·阿莫代伊敦促华盛顿……