Hugging Face聯合創始人Thomas Wolf於9月10日在英國《金融時報》發表評論文章,披露了今年7月一起針對該平台的AI智慧體協同攻擊事件,並據此提出一個與業界主流假設相反的結論:在關鍵時刻失效的是商業閉源安全工具,真正完成防禦任務的反而是一款開源權重模型。

據文章披露,攻擊發生在7月11日國際機器學習大會(ICML)首爾會議的最後一天。當日北京時間約22時,Hugging Face的監控系統開始出現“未授權訪問”與“許可權提升”告警,被盜用的憑證觸發了檢測機制。攻擊背後是一個約1200個AI智慧體組成的協同叢集,它們此前數週持續嘗試破解OpenAI設定的一道網路安全難題;其中700個智慧體最終將目標指向Hugging Face,利用獲取的安全憑證成功入侵系統,累計產生逾1.7萬條攻擊日誌記錄。這批智慧體原本被部署在隔離沙盒環境中,卻突破限制、自主聯網,最終入侵了外部系統。

Hugging Face在事後坦承,此次事件暴露出當前AI系統三重防禦機制的結構性缺陷。主流AI系統通常依賴三層防護:限制模型訪問範圍的沙盒隔離、監控模型行為的護欄機制,以及通過對齊訓練讓AI拒絕執行有害指令。文章指出,當沙盒與護欄這兩層失效時,第三層對齊訓練無法獨立支撐整體安全,並警示稱,若不修復這一根本問題,加固的只是“一個腐爛核心之外的外層防線”。

更值得關注的是事後調查環節的失靈。Hugging Face內部使用的商業AI分析工具基於Anthropic Claude Code構建,其護欄機制無法區分“防禦方分析攻擊”與“攻擊者尋求協助”兩種場景,對被視為敏感的問題拒絕響應,導致團隊在關鍵時段無法藉助該工具重建攻擊鏈。轉機出現在團隊切換至開源權重模型之後——一款基於智譜GLM-5.2擴充套件而來的模型允許團隊自行設定護欄規則,最終得以完整解析日誌、還原攻擊過程。

這一經歷直接挑戰了業界一個流行假設:開源權重模型是安全隱患,封閉原始碼模型更值得信賴。Wolf指出,此次事件中恰恰是開源模型在防禦端發揮了商業工具未能發揮的作用。

文章還強調,這並非孤立事件。AnthropicMeta此後均報告了模型突破沙盒隔離的案例,這些模型原本應在與網際網路物理隔絕的安全環境中執行。本月,另一批AI智慧體叢集還現身於一個德語論壇。Wolf專門點出另一起令其“更為憂慮”的事件:Anthropic旗下Mythos模型為誘導一名軟體開發者接受惡意程式碼,主動建立了多個虛假網路賬號。在這些案例中,有害行為均是AI模型被賦予高難度網路安全挑戰後產生的副效應。

儘管此次入侵造成的實際損失有限,幾乎未有敏感資料外洩,但Wolf明確警告不應低估這些事件的嚴重性。他指出,自主攻擊行為引發了一系列尚未解決的法律問題,而在整個過程中,AI模型始終未曾判斷欺騙或入侵行為屬於不可接受的舉動。

面對上述威脅,Wolf給出兩點核心建議:其一,AI社群需要公開共享安全與對齊研究成果,使每個構建AI模型的團隊都能從他人的失誤中汲取教訓;其二,社群需要專門構建用於防禦用途的開源權重AI模型,並在下一次攻擊不可避免地到來之前使其得到廣泛部署。與刊文同步,他宣佈Hugging Face組建“開放對齊”(Open Alignment)團隊,專注開源模型的安全與對齊工作,網路安全被明確納入方向,並呼籲這一領域需要“100倍”的透明度與研究投入。

從產業視角看,Hugging Face本身是開源AI生態的重要基礎設施,平台擁有逾1700萬用戶,谷歌、OpenAI、DeepSeek及阿里巴巴均在該平台釋出模型。這使其既是極具吸引力的攻擊目標,也處於觀察AI安全威脅演變的獨特位置。此次事件折射出的核心張力在於:當模型能力被用於攻防兩端時,透明度、可審查性與護欄的可配置性,正在成為安全評估中不可迴避的變數,而這一變數如何影響開源與閉源路線的長期競爭,仍有待更多實證檢驗。