Anthropic的前沿红队(Frontier Red Team)发布分析称,智谱AI的开源权重模型GLM-5.3在漏洞利用开发上已接近其自家的Claude Mythos Preview。该团队表示,GLM-5.3能够自主构建完整的网络攻击利用程序,与Mythos Preview类似;但与其它具备相近能力的模型不同,它发布时并未配备有效的安全防护。

Anthropic当初刻意推迟了Mythos Preview的开放,仅通过Project Glasswing向部分防御方提供访问权限,以便他们抢先排查风险。该公司称,这些防御方此后已在关键软件中发现超过1万个漏洞。OpenAI也采取了类似做法,推出Daybreak。相比之下,GLM-5.3任何人都可以下载。

在衡量模型利用Chrome V8引擎已知漏洞能力的ExploitBench基准上,GLM-5.3在410次尝试中成功构建了50次可用利用,Mythos Preview为56次。Anthropic还运行了一个基于谷歌OSS-Fuzz开源项目的内部二进制利用基准,GLM-5.3在4%的任务中完全控制了目标程序,Mythos Preview为6%。较早的模型如GLM-5.2和Claude Opus 4.6两项测试均未通过,Kimi K3与DeepSeek V4.1-Flash则几乎为零。

Anthropic还将GLM-5.3与人类专家配对使用。在一天之内、人工干预很少的情况下,该模型在一款广泛使用的浏览器的JavaScript引擎中发现了多个此前未知的漏洞,并将它们串联成一个网页,可读取访问者电脑上的任意文件;在测试中它提取出了一把私有的SSH密钥。Anthropic称已将漏洞报告给浏览器开发者,驱动程序和设备固件中的其它发现仍在审查中。

Anthropic还用较小的GLM-5.3-Flash测试了从漏洞披露到形成可用攻击的速度。该模型将一个新披露的Chrome漏洞与另一个已知漏洞结合,在极少指导下构建出可靠攻击,甚至绕过了处理器内置的一项额外安全功能。整个过程耗费20分钟人工注意力和8小时模型时间,按智谱API价格计算成本为20.40美元。

美国机构CAISI在独立评估中得出相近结论,称GLM-5.3是迄今网络能力最强的开源权重模型,约落后美国最佳模型四个月。该比较附有说明:CAISI测试美国模型时关闭了其网络防护,且顶级梯队中包含仅限经过审核用户访问的模型。

在Anthropic的一项模拟中,GLM-5.3拒绝了公开恶意的攻击指令。但当同一请求被包装成红队演练时,模型在64%的运行中尝试连接目标系统;加入预填推理步骤后升至92%;经过abliteration(一种从开源权重中剥离拒绝行为的技术)后达到100%。该模拟不执行任何代码,因此无法证明攻击是否真的会成功。受保护的Claude模型始终为零。Anthropic团队称这是其首次使用abliteration,过程耗时约2200 GPU小时、成本约4400美元,并估计有经验的团队可以做到约1200美元。有害请求的拒绝率从90%以上降至2%至12%,而科学与网络测试得分几乎没有变化。据Anthropic称,已有多个开发者在模型发布后数日内放出了解除限制的版本。

Anthropic的结论是,国家和非国家行为体很可能利用GLM-5.3这类模型造成实际危害,并援引自身及其它美国实验室的报告,指出已有攻击者在使用AI。该公司主张政府应对高能力模型进行测试,防御方需要至少与对手同等水平的工具。

这份分析并非完全无私。Anthropic不公开模型权重,而报告恰恰将这一点呈现为关键安全优势;一个接近前沿的廉价中国开源权重模型也是直接竞争对手。报告结论同样契合其商业利益:公司希望把Claude的网络能力带给更多防御方,经过审核的用户已可使用Claude Mythos 5.1。其呼吁政府对GLM-5.3的后续模型进行测试,也容易引发「监管俘获」的质疑,即规则最终主要保护现有玩家。

不过,这并非全是私利。CAISI的独立评估支持了能力数据,且解除限制的模型版本已经流出。英国AI安全研究所(AISI)近期发现,开源模型在网络能力上的落后差距已从六到十个月缩小到四到七个月。该机构称,开源模型运行成本也低得多,其防护措施基本无效。AISI警告存在持续且不可逆的滥用风险,但也指出私有部署、定制化和低成本等实际好处。