美國初創公司 Abliteration.ai 推出了一項商業服務,通過 API 提供去除安全機制的開源權重模型,目前基於智譜 AI 的 GLM-5.3 模型。該服務旨在用於進攻性網路安全測試和紅隊演練,但記者輕易生成了惡意軟體指令,引發安全風險擔憂。

所謂“abliteration”技術,並非簡單的提示詞越獄,而是通過修改模型內部啟用模式,抑制其拒絕敏感請求的機制。Abliteration.ai 聲稱,修改後的模型在編碼、網路和代理能力上基本保持完整。該公司在 8 月底釋出了“abliterated-model-large-v2”,並宣稱其在 CyberGym 基準測試中得分 84.5%,在 Terminal-Bench 4.0 上得分 41.8%,並在兩小時內解決了 105 個 ExploitGym 任務。不過,該公司也承認,這些分數來自不同的測試平台和計算預算,直接比較存在侷限。

Abliteration.ai 選擇 GLM-5.3 作為基礎,因其開放權重且許可允許修改和商業託管。此前版本基於 GLM-5.2。智譜 AI 曾表示,GLM-5.3 的網路能力在後期訓練中增長超預期。其他可選模型包括 QwenDeepSeek 和 Mistral。

該服務按 token 收費,標準費率為每百萬輸入或輸出 token 5 美元。客戶無需下載模型或自建 GPU 基礎設施,即可通過 API 訪問。這種“交鑰匙”模式降低了使用門檻,但也可能被濫用。

公司匿名創始人在播客中表示,早期需求主要來自測試大型組織和銀行部署的 AI 代理的公司,以檢查攻擊者能否通過越獄或提示注入觸發未經授權的操作。然而,安全研究機構 SaferAI 指出,未修改的 GLM-5.2 在進攻性安全評估中已能拒絕零任務,暗示去護欄可能並非必需。一些紅隊服務提供商也對此表示懷疑,稱其常規工作並不依賴此類模型。

TechCrunch 報道稱,記者輕鬆讓該模型生成了提取 Chrome 儲存密碼的程式碼,以及培育危險病原體的詳細指南。不過,模型仍會拒絕涉及自殘的請求,並阻止涉及兒童的性內容。Abliteration.ai 表示,提示和響應不會被儲存,但會保留 token 計數、時間戳等操作後設資料。公司不要求身份驗證,這雖保護了合法安全團隊的機密,但也使濫用調查變得困難。

Abliteration.ai 提供可選的政策閘道器,允許企業客戶自定義規則。該服務的商業化為 AI 安全測試提供了新工具,但同時也引發了關於開源模型安全與監管的討論。如何在合法使用與潛在濫用之間取得平衡,仍是業介面臨的難題。