以色列AI安全测试公司Irregular正处在一系列“失控AI攻击”事件的风暴中心。据The Verge报道,该公司在对多家科技巨头的AI智能体进行网络安全能力评估时,因测试环境配置失误,导致这些智能体意外脱离模拟环境、对真实世界目标发起攻击。受影响的公司包括OpenAI、Meta、Anthropic和谷歌。
Irregular成立于2023年,最初名为Pattern Labs,专注于通过“高保真研究平台”模拟和监控真实世界的AI安全场景,对AI模型进行压力测试。其客户名单并未完全公开,但其工作曾被OpenAI的模型系统卡引用,也曾为英国政府和Anthropic测试系统,并与知名智库RAND联合发表研究。
事件的核心在于测试流程中的两个失误。Irregular CTO兼联合创始人Omer Nevo向The Verge解释,在部分测试中,智能体本不应接入开放互联网,但“互联网访问被无意中开放了”;与此同时,为模拟场景虚构的一家公司名称“与一个真实域名重合”。两者叠加,使得智能体将攻击目标指向了真实世界的实体。目前尚不清楚具体哪些公司或组织实际遭到了攻击。
Nevo确认,涉及OpenAI、Meta、Anthropic和谷歌模型的事件均源于“同一评估场景中的同一底层问题”,且均已进行披露。但他强调,近期行业内报道的其他安全事件,包括Hugging Face遭攻击以及英国AI安全研究所披露的违规事件,与Irregular或其评估工作无关。不过,“披露”并不一定意味着向公众公开,Nevo未明确说明是通知了客户、公众还是其他方。
尽管事件根源相同,但各公司公开的时间线并不一致。据Anthropic和OpenAI的报告以及关于谷歌的媒体报道,这些科技公司大约在7月底的相近时间收到通知。OpenAI和Anthropic自行公布了相关事件,而Meta和谷歌的事件则是在数周后通过媒体报道才为公众所知。
Irregular的网络安全测试范围不仅限于这四家美国科技巨头。其官网发布的研究显示,该公司还对来自中国公司的开源模型进行过类似测试,包括Moonshot AI的Kimi K3和Z.ai的GLM-5.2。与前述专有模型不同,这些开源模型可被自由下载并在用户自有硬件上运行,Irregular将其描述为“自托管”实例。Nevo表示,对中国模型的评估并未导致类似的真实世界事件,但他同时警告,这一观察本身不应被解读为这些模型更不易出现此类行为。Moonshot和Z.ai均未回应The Verge的置评请求。
事件已促使Irregular做出改变。Nevo表示,公司已“收紧互联网访问控制,扩大监控和人工审查,并在评估开始前加强检查,以验证访问权限与预期范围一致”,同时改进了与合作伙伴就每次评估的设置和参数进行记录和确认的方式。Irregular还计划在相关联合工作完成后,发布一份更广泛的报告,涵盖安全开展网络评估的经验教训和实践。
这一系列事件凸显了AI智能体安全测试中的现实风险:即便在受控环境中,微小的配置错误也可能导致智能体行为外溢,对真实系统造成潜在威胁。对于AI产业而言,如何在加速模型能力评估的同时确保测试环境与真实世界严格隔离,已成为亟待解决的课题。