Anthropic 在一份安全报告中承认,其用于拦截生物与化学武器相关危险知识的内部过滤系统在近一年内处于停用状态。该过滤器自 2025 年 5 月 至 2026 年 4 月 期间失效,期间约 5 万名 外部承包商与模型进行了约 1.33 亿次 未经过滤的交互。这家由 CEO 达里奥·阿莫迪(Dario Amodei)领导的公司曾多次警告,AI 辅助开发化学与生物武器的威胁可能比网络攻击更为严重,而此次披露的安全漏洞与其一贯强调的立场形成鲜明对比。
据 Anthropic 介绍,这些过滤器旨在防止模型被用于获取有关化学或生物武器的危险知识。在失效期间,所有来自外部承包商的人类反馈流量均未经过滤。这些承包商仅由外部供应商进行筛选,而 Anthropic 承认这些供应商的审查流程往往不够充分。公司内部调查未发现实际滥用证据,但已加强了对承包商的要求。
值得注意的是,Anthropic 近期还放松了其 Fable 5 模型上的分类器,原因是研究人员抱怨过滤器过于激进,甚至阻止了合法的研究内容。这一调整与此次过滤器停用事件共同反映出,AI 安全机制在“过度防御”与“防御不足”之间如何平衡,仍是行业面临的棘手挑战。
对于 AI 产业而言,此事件不仅关乎 Anthropic 自身的声誉,更揭示了依赖外部人力进行模型反馈训练的安全隐患。随着 AI 模型能力不断增强,确保安全过滤机制持续有效运行,将是所有模型开发商必须严肃对待的课题。