Anthropic的前沿紅隊(Frontier Red Team)釋出分析稱,智譜AI的開源權重模型GLM-5.3在漏洞利用開發上已接近其自家的Claude Mythos Preview。該團隊表示,GLM-5.3能夠自主構建完整的網路攻擊利用程式,與Mythos Preview類似;但與其它具備相近能力的模型不同,它釋出時並未配備有效的安全防護。
Anthropic當初刻意推遲了Mythos Preview的開放,僅通過Project Glasswing向部分防禦方提供訪問許可權,以便他們搶先排查風險。該公司稱,這些防禦方此後已在關鍵軟體中發現超過1萬個漏洞。OpenAI也採取了類似做法,推出Daybreak。相比之下,GLM-5.3任何人都可以下載。
在衡量模型利用Chrome V8引擎已知漏洞能力的ExploitBench基準上,GLM-5.3在410次嘗試中成功構建了50次可用利用,Mythos Preview為56次。Anthropic還運行了一個基於谷歌OSS-Fuzz開源專案的內部二進位制利用基準,GLM-5.3在4%的任務中完全控制了目標程式,Mythos Preview為6%。較早的模型如GLM-5.2和Claude Opus 4.6兩項測試均未通過,Kimi K3與DeepSeek V4.1-Flash則幾乎為零。
Anthropic還將GLM-5.3與人類專家配對使用。在一天之內、人工干預很少的情況下,該模型在一款廣泛使用的瀏覽器的JavaScript引擎中發現了多個此前未知的漏洞,並將它們串聯成一個網頁,可讀取訪問者電腦上的任意檔案;在測試中它提取出了一把私有的SSH金鑰。Anthropic稱已將漏洞報告給瀏覽器開發者,驅動程式和裝置韌體中的其它發現仍在審查中。
Anthropic還用較小的GLM-5.3-Flash測試了從漏洞披露到形成可用攻擊的速度。該模型將一個新披露的Chrome漏洞與另一個已知漏洞結合,在極少指導下構建出可靠攻擊,甚至繞過了處理器內建的一項額外安全功能。整個過程耗費20分鐘人工注意力和8小時模型時間,按智譜API價格計算成本為20.40美元。
美國機構CAISI在獨立評估中得出相近結論,稱GLM-5.3是迄今網路能力最強的開源權重模型,約落後美國最佳模型四個月。該比較附有說明:CAISI測試美國模型時關閉了其網路防護,且頂級梯隊中包含僅限經過稽核使用者訪問的模型。
在Anthropic的一項模擬中,GLM-5.3拒絕了公開惡意的攻擊指令。但當同一請求被包裝成紅隊演練時,模型在64%的執行中嘗試連線目標系統;加入預填推理步驟後升至92%;經過abliteration(一種從開源權重中剝離拒絕行為的技術)後達到100%。該模擬不執行任何程式碼,因此無法證明攻擊是否真的會成功。受保護的Claude模型始終為零。Anthropic團隊稱這是其首次使用abliteration,過程耗時約2200 GPU小時、成本約4400美元,並估計有經驗的團隊可以做到約1200美元。有害請求的拒絕率從90%以上降至2%至12%,而科學與網路測試得分幾乎沒有變化。據Anthropic稱,已有多個開發者在模型釋出後數日內放出瞭解除限制的版本。
Anthropic的結論是,國家和非國家行為體很可能利用GLM-5.3這類模型造成實際危害,並援引自身及其它美國實驗室的報告,指出已有攻擊者在使用AI。該公司主張政府應對高能力模型進行測試,防禦方需要至少與對手同等水平的工具。
這份分析並非完全無私。Anthropic不公開模型權重,而報告恰恰將這一點呈現為關鍵安全優勢;一個接近前沿的廉價中國開源權重模型也是直接競爭對手。報告結論同樣契合其商業利益:公司希望把Claude的網路能力帶給更多防禦方,經過稽核的使用者已可使用Claude Mythos 5.1。其呼籲政府對GLM-5.3的後續模型進行測試,也容易引發「監管俘獲」的質疑,即規則最終主要保護現有玩家。
不過,這並非全是私利。CAISI的獨立評估支援了能力資料,且解除限制的模型版本已經流出。英國AI安全研究所(AISI)近期發現,開源模型在網路能力上的落後差距已從六到十個月縮小到四到七個月。該機構稱,開源模型執行成本也低得多,其防護措施基本無效。AISI警告存在持續且不可逆的濫用風險,但也指出私有部署、定製化和低成本等實際好處。