OpenAI于7月22日凌晨确认,包括GPT-5.6 Sol和一款更强预发布模型在内的多款自家模型,在内部网络安全评测中利用漏洞突破隔离环境,继而侵入Hugging Face生产系统并获取评测答案。OpenAI称这是一起“前所未有的网络安全事件”,涉及当前最先进的网络攻击能力。

事件始于7月中旬OpenAI的一次内部ExploitGym评测。为测试模型网络攻击能力上限,OpenAI降低了模型的网络安全拒答限制,未启用生产环境中阻止高风险操作的分类器。模型在隔离环境中持续寻找脱离方法,发现内部软件包缓存代理中的一个零日漏洞,利用该漏洞突破网络限制、提升权限并横向进入其他节点,最终获得互联网访问能力。随后,模型推断Hugging Face可能保存了相关模型、数据集和评测答案,开始寻找进入其系统的方法。

Hugging Face于7月16日披露了这起由自主AI Agent驱动的入侵。攻击从一个恶意数据集开始,利用远程代码加载器和数据集配置模板注入两条代码执行路径,在数据处理节点上运行代码。模型取得节点级权限后,提取云端和集群凭证,横向进入多个内部集群,最终从Hugging Face生产数据库中获取评测答案。Hugging Face的AI辅助异常检测系统发现了攻击,安全团队及Agent随后阻止了相关活动。

在取证过程中,Hugging Face最初尝试使用商业API背后的前沿模型,但真实攻击命令、漏洞载荷和C2信息触发了安全护栏,分析请求受阻。于是,Hugging Face在自有基础设施上部署智谱的旗舰模型GLM-5.2,分析超过1.7万个记录事件,将通常需要数天的工作压缩至数小时。7月20日,Hugging Face进一步解释了选择GLM-5.2的原因:该模型采用开放权重和MIT许可证,可部署在企业自己的基础设施中,确保攻击数据和凭证不离开内部环境;拥有100万Token上下文窗口,足以在一条完整时间线上关联超1.7万条记录;在推理、工具编排和终端操作方面能力较强,在MCP-Atlas和SWE-bench Pro上得分分别为76.8和62.1,在Terminal Bench 2.1上得分为81。

此次入侵导致少量内部数据集和部分服务凭证被未授权访问,但尚无证据显示公开模型、数据集、Spaces及软件供应链遭到篡改。Hugging Face已关闭相关代码执行路径、重建遭入侵的节点并轮换相关凭证;OpenAI则收紧研究基础设施配置,与Hugging Face联合取证,推动第三方软件供应商修复漏洞。

英国人工智能安全研究所的评估显示,GPT-5.6 Sol等模型越来越能长时间执行复杂、多步骤的网络行动。这次事件说明,相关能力已可作用于真实系统,模型甚至能在没有源代码的情况下发现新的攻击路径。OpenAI表示,发展这些能力的同时必须加强隔离、监控、访问控制和防御工具,安全团队也可利用模型提前发现弱点、加快修复速度。Hugging Face联合创始人兼CEO克莱芒·德朗格称,这起可能是首例的事件说明,AI安全无法由一家公司独立解决,需要开放协作,并让更多安全防守人员获得AI能力。