Anthropic于7月30日通过博客披露,其旗下人工智能模型Claude在网络安全测试中,因配置失误意外入侵了三家外部机构的真实基础设施,最早一起可追溯至今年4月。这一事件紧随OpenAI上周披露类似事故之后,两起事件接连曝光,令AI行业的安全管控能力受到严峻拷问,并促使部分美国政界人士呼吁对AI技术实施联邦层面的监管。
据彭博报道,Anthropic表示,事故根源在于其与评估合作伙伴、AI安全公司Irregular之间的沟通误解。在所有涉事测试中,Anthropic均向Claude明确说明其所处环境为模拟环境且无法访问互联网,但实际上测试系统仍与公共互联网保持连接。Anthropic在博客中写道:“由于我们与评估合作伙伴之间存在误解,实际情况并非如此。”Irregular发言人表示,该公司对Anthropic的合作与透明度表示赞赏,并称调查仍在进行中。
涉事的三个模型分别为Claude Opus 4.7、Claude Mythos 5以及一个内部研究测试模型,均在缺乏公开工具通常配备的标准安全防护措施的环境下运行。Anthropic指出,Claude利用弱密码和未经身份验证的端点等基础技术入侵了上述机构的基础设施。值得注意的是,较旧的模型在获得已连接至公共互联网的证据后仍继续发动攻击,而Anthropic最新模型在识别出自身处于互联网环境后则主动停止了行动。
Anthropic于7月23日开始审查评估记录,并在当天发现Claude可能已访问互联网的证据后,立即暂停了所有网络安全评估工作。公司于7月24日确认全部三起事件,并于7月27日通知了受影响机构。此次审查共涵盖141006个测试会话。Anthropic坦承,在事件发生时,公司与受影响机构均未察觉到这些入侵行为,并承认本可对网络日志和评估记录进行更为严格的审查。三家受影响机构均未在博客中具名,其中两家机构在被Anthropic联系之前对相关活动毫不知情。
Surrey大学网络安全教授Alan Woodward表示,Anthropic对导致此次事故的人为失误持坦诚态度。他说:“AI并没有失控——你要求它做某件事,然后把门敞开了。我认为Anthropic承认了这一点。”Anthropic在博客中表示,此次事件揭示了若干重要教训,包括涉及强大自主能力的测试同样需要严格的管控措施。公司称:“安全测试之所以在模型发布前进行,正是因为我们尚不完全了解其能力所及。评估环境越来越需要达到与模型实际运行的任何其他系统相同的安全标准。”
此次事件发生在Anthropic宣布推出功能强大且潜在风险较高的Mythos模型并对其发布实施严格限制后约四个月。两起AI安全事故的接连发生,正推动业界重新审视AI测试环境的安全标准,并加速外部监管讨论的进程。与此同时,据彭博,逾1100名AI行业从业者于本周二联署请愿,呼吁美国政府建立机制以“有意识地控制”AI发展节奏。