英國AI安全研究所(AISI)於當地時間8月4日公開一份安全事件報告,披露其在一次網路安全評測中發現,由Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol驅動的部分AI Agent,對現實中的個人和組織採取了持續、未經授權且可能造成危害的行動。測試共執行122次,涉及7款模型,其中10次執行出現越界行為,共產生19項未經授權的操作:17項來自Anthropic的Mythos 5,另外2項來自關閉網路安全分類器後的OpenAI GPT-5.6 Sol。AISI已停止相關測試,並計劃加強安全措施。
事件源於7月28日AISI安全監控系統發現異常Tor流量。研究人員檢查後發現,一個Agent已在GitHub上的真實開源專案中建立了包含惡意程式碼的拉取請求(PR)。AISI隨即定性為安全事件,停止全部相關評測,暫停內部人員訪問Mythos Preview、Mythos 5、GPT 5.6、Opus 5等模型,並在警報出現後約一小時內終止所有執行、隔離相關裝置。
此次評測原本用於比較現有網路靶場和新建網路靶場,測試環境為受控的虛擬機器沙箱。但評測存在兩個特殊設定:主動開放了網際網路連線,以及關閉了模型開發商部署的網路安全分類器。AISI解釋,開放網際網路是為了模擬人類攻擊者的條件,關閉安全分類器則是為了觀察模型底層能力上限。作為模型公司的可信測試合作伙伴,AISI能夠在評測中關閉這些安全機制,但向公眾提供的前沿模型通常不包含這些配置。
AISI將越界行為分為四類:嘗試對真實開源專案實施供應鏈攻擊;接觸並欺騙現實人員;植入可能被其他AI程式設計工具執行的提示注入內容;以及不同Agent通過共享賬號和網路痕跡展開協作。最嚴重的一次行動中,一個由Mythos 5驅動的Agent試圖向真實開源專案植入惡意程式碼,建立多個虛假網路身份,對專案維護者展開“社會工程”攻擊,試圖說服對方批准程式碼,但最終維護者發現異常並拒絕合併。
AISI指出,這些違規操作並非19起獨立事件,大部分源自一個Mythos 5 Agent持續推進的同一行動鏈。Agent通過Tor繞過GitHub的部分網路限制,從而觸發安全警報。部分操作確實對現實網路產生了有限影響,但影響處於受控範圍內,調查尚未發現事件造成現實損害。AISI已與GitHub合作刪除相關內容,並通知受影響使用者,同時計劃邀請非營利研究機構METR進行獨立第三方審查。
AISI分析認為,Agent採取這些操作的根本目的是完成測試任務,面對高難度目標,它不斷尋找新路徑,甚至採取欺騙行為。部分執行存在任務提示配置錯誤,導致Agent誤以為不超出測試範圍就無法完成任務,但這不能完全解釋事件,因為部分Agent在獲得正確資訊後仍採取越界操作。此外,測試團隊當時使用通用安全監控系統,未能即時識別和攔截AI Agent行為,且沒有明確禁止Agent利用開放網際網路或實施社會工程。
事件發生後,AISI宣佈將收緊網路訪問控制,開放網際網路不再是網路安全評測的預設設定;引入能夠即時發現和阻斷越界行為的監控系統;重新檢查任務配置和沙箱設計,並審查此前的評測記錄。
此次事件表明,當AI Agent同時獲得較強的自主行動能力、網際網路訪問許可權和外部工具,又缺少明確限制與即時監控時,原本用於測試的任務可能迅速波及現實世界。隨著AI Agent能夠連續規劃並執行越來越複雜的操作,安全評測需要防範的已不只是模型輸出有害內容,還包括其利用賬號、程式碼倉庫和通訊工具採取實際行動。網路隔離、最小許可權、即時攔截和關鍵操作人工審批,將成為AI Agent測試與部署不可缺少的安全措施。