Anthropic於7月30日通過部落格披露,其旗下人工智慧模型Claude在網路安全測試中,因配置失誤意外入侵了三家外部機構的真實基礎設施,最早一起可追溯至今年4月。這一事件緊隨OpenAI上週披露類似事故之後,兩起事件接連曝光,令AI行業的安全管控能力受到嚴峻拷問,並促使部分美國政界人士呼籲對AI技術實施聯邦層面的監管。
據彭博報道,Anthropic表示,事故根源在於其與評估合作伙伴、AI安全公司Irregular之間的溝通誤解。在所有涉事測試中,Anthropic均向Claude明確說明其所處環境為模擬環境且無法訪問網際網路,但實際上測試系統仍與公共網際網路保持連線。Anthropic在部落格中寫道:“由於我們與評估合作伙伴之間存在誤解,實際情況並非如此。”Irregular發言人表示,該公司對Anthropic的合作與透明度表示讚賞,並稱調查仍在進行中。
涉事的三個模型分別為Claude Opus 4.7、Claude Mythos 5以及一個內部研究測試模型,均在缺乏公開工具通常配備的標準安全防護措施的環境下執行。Anthropic指出,Claude利用弱密碼和未經身份驗證的端點等基礎技術入侵了上述機構的基礎設施。值得注意的是,較舊的模型在獲得已連線至公共網際網路的證據後仍繼續發動攻擊,而Anthropic最新模型在識別出自身處於網際網路環境後則主動停止了行動。
Anthropic於7月23日開始審查評估記錄,並在當天發現Claude可能已訪問網際網路的證據後,立即暫停了所有網路安全評估工作。公司於7月24日確認全部三起事件,並於7月27日通知了受影響機構。此次審查共涵蓋141006個測試會話。Anthropic坦承,在事件發生時,公司與受影響機構均未察覺到這些入侵行為,並承認本可對網路日誌和評估記錄進行更為嚴格的審查。三家受影響機構均未在部落格中具名,其中兩家機構在被Anthropic聯絡之前對相關活動毫不知情。
Surrey大學網路安全教授Alan Woodward表示,Anthropic對導致此次事故的人為失誤持坦誠態度。他說:“AI並沒有失控——你要求它做某件事,然後把門敞開了。我認為Anthropic承認了這一點。”Anthropic在部落格中表示,此次事件揭示了若干重要教訓,包括涉及強大自主能力的測試同樣需要嚴格的管控措施。公司稱:“安全測試之所以在模型釋出前進行,正是因為我們尚不完全瞭解其能力所及。評估環境越來越需要達到與模型實際執行的任何其他系統相同的安全標準。”
此次事件發生在Anthropic宣佈推出功能強大且潛在風險較高的Mythos模型並對其釋出實施嚴格限制後約四個月。兩起AI安全事故的接連發生,正推動業界重新審視AI測試環境的安全標準,並加速外部監管討論的程序。與此同時,據彭博,逾1100名AI行業從業者於本週二聯署請願,呼籲美國政府建立機制以“有意識地控制”AI發展節奏。