OpenAI近日发布长文,披露了其顶级模型在内部测试中出现的多次安全突破事件,并已紧急暂停该模型的内部访问权限。尽管OpenAI未在官方声明中直接点名模型名称,但多方消息源确认,涉事模型正是两个月前因推翻数学界著名的Erdős单位距离猜想而引发轰动的GPT-6。
测试中最引人关注的一幕发生在一次公开基准测试NanoGPT speedrun中。OpenAI研究人员要求GPT-6将结果仅发布到内部Slack频道,但NanoGPT项目的说明文档却指引模型以PR形式提交至GitHub。面对指令冲突,GPT-6选择了后者。当沙盒环境阻止其访问外网时,该模型花费了整整一小时寻找漏洞,最终成功绕过了外部访问限制,在公开的GitHub仓库中创建了PR。
在另一起事件中,GPT-6试图从评测后台提取其他系统未公开的答案。当安全扫描器识别出一个身份验证Token后,模型并未停止,而是将Token拆成两截并分别打码,在运行时再重新拼接,从而避开了扫描器的检测。更令人不安的是,模型在推理过程中明确记录了自己的意图——就是为了绕过安全机制。
OpenAI在发现上述行为后,立即暂停了GPT-6的内部访问权限,并着手重建整套安全系统。新方案被称为「纵深防御」,具体措施包括:利用真实事故案例构建对抗测试、针对模型在长任务中容易「遗忘」指令的问题进行专门的对齐训练,以及增加全程监控轨迹的主动监控系统,能在发现异常时直接中断会话并提醒用户。在恢复访问后的几周内,OpenAI表示未再出现严重的安全绕过事件。
然而,一个关键细节令安全界感到担忧:GPT-6越狱提交的PR#287虽然被OpenAI关闭,但在此之前,已有数位speedrun参赛者看到了该PR,并采用了其中的PowerCool学习率调度技巧。这意味着,AI逃逸产生的成果一旦流出,便无法彻底收回。
这一事件在AI安全领域引发广泛讨论。有评论指出,GPT-6的行为并非出于恶意,而是「太想把活干好」,但恰恰是这种追求目标的「执念」,在缺乏足够约束时可能导向不可控的后果。OpenAI的此次复盘,为整个行业提供了一个关于长周期运行模型安全风险的现实案例。