Anthropic 在一份安全報告中承認,其用於攔截生物與化學武器相關危險知識的內部過濾系統在近一年內處於停用狀態。該過濾器自 2025 年 5 月 至 2026 年 4 月 期間失效,期間約 5 萬名 外部承包商與模型進行了約 1.33 億次 未經過濾的互動。這家由 CEO 達里奧·阿莫迪(Dario Amodei)領導的公司曾多次警告,AI 輔助開發化學與生物武器的威脅可能比網路攻擊更為嚴重,而此次披露的安全漏洞與其一貫強調的立場形成鮮明對比。
據 Anthropic 介紹,這些過濾器旨在防止模型被用於獲取有關化學或生物武器的危險知識。在失效期間,所有來自外部承包商的人類反饋流量均未經過濾。這些承包商僅由外部供應商進行篩選,而 Anthropic 承認這些供應商的審查流程往往不夠充分。公司內部調查未發現實際濫用證據,但已加強了對承包商的要求。
值得注意的是,Anthropic 近期還放鬆了其 Fable 5 模型上的分類器,原因是研究人員抱怨過濾器過於激進,甚至阻止了合法的研究內容。這一調整與此次過濾器停用事件共同反映出,AI 安全機制在“過度防禦”與“防禦不足”之間如何平衡,仍是行業面臨的棘手挑戰。
對於 AI 產業而言,此事件不僅關乎 Anthropic 自身的聲譽,更揭示了依賴外部人力進行模型反饋訓練的安全隱患。隨著 AI 模型能力不斷增強,確保安全過濾機制持續有效執行,將是所有模型開發商必須嚴肅對待的課題。