美国初创公司 Abliteration.ai 推出了一项商业服务,通过 API 提供去除安全机制的开源权重模型,目前基于智谱 AI 的 GLM-5.3 模型。该服务旨在用于进攻性网络安全测试和红队演练,但记者轻易生成了恶意软件指令,引发安全风险担忧。

所谓“abliteration”技术,并非简单的提示词越狱,而是通过修改模型内部激活模式,抑制其拒绝敏感请求的机制。Abliteration.ai 声称,修改后的模型在编码、网络和代理能力上基本保持完整。该公司在 8 月底发布了“abliterated-model-large-v2”,并宣称其在 CyberGym 基准测试中得分 84.5%,在 Terminal-Bench 4.0 上得分 41.8%,并在两小时内解决了 105 个 ExploitGym 任务。不过,该公司也承认,这些分数来自不同的测试平台和计算预算,直接比较存在局限。

Abliteration.ai 选择 GLM-5.3 作为基础,因其开放权重且许可允许修改和商业托管。此前版本基于 GLM-5.2。智谱 AI 曾表示,GLM-5.3 的网络能力在后期训练中增长超预期。其他可选模型包括 QwenDeepSeek 和 Mistral。

该服务按 token 收费,标准费率为每百万输入或输出 token 5 美元。客户无需下载模型或自建 GPU 基础设施,即可通过 API 访问。这种“交钥匙”模式降低了使用门槛,但也可能被滥用。

公司匿名创始人在播客中表示,早期需求主要来自测试大型组织和银行部署的 AI 代理的公司,以检查攻击者能否通过越狱或提示注入触发未经授权的操作。然而,安全研究机构 SaferAI 指出,未修改的 GLM-5.2 在进攻性安全评估中已能拒绝零任务,暗示去护栏可能并非必需。一些红队服务提供商也对此表示怀疑,称其常规工作并不依赖此类模型。

TechCrunch 报道称,记者轻松让该模型生成了提取 Chrome 保存密码的代码,以及培育危险病原体的详细指南。不过,模型仍会拒绝涉及自残的请求,并阻止涉及儿童的性内容。Abliteration.ai 表示,提示和响应不会被存储,但会保留 token 计数、时间戳等操作元数据。公司不要求身份验证,这虽保护了合法安全团队的机密,但也使滥用调查变得困难。

Abliteration.ai 提供可选的政策网关,允许企业客户自定义规则。该服务的商业化为 AI 安全测试提供了新工具,但同时也引发了关于开源模型安全与监管的讨论。如何在合法使用与潜在滥用之间取得平衡,仍是业界面临的难题。