一名Anthropic研究員因擔憂AI失控而離職,成為該公司首批因安全顧慮出走的員工之一,事件再次將頂級AI實驗室內部的安全分歧推向台前。據《華爾街日報》報道,27歲的英國研究員Jacob Coxon於週二宣佈離職,理由是不願參與一場他認為將導致AI系統失控的行業競賽。他警告稱,最快到明年底,局面就可能已經“失控”。

Coxon擁有數學專業背景,專注於通過海量資料訓練新AI模型。他透露,自己此前曾離開OpenAI轉投Anthropic,正是因為後者以模型安全著稱。然而,即便他認可Anthropic在安全方面的努力是真誠的,他仍得出結論:在缺乏政府幹預或行業協調減速的前提下,沒有任何一家公司能夠負責任地開發出在各類任務上超越人類的AI系統,即通用人工智慧(AGI)。

Coxon指出,他的許多同行如今已習慣用“決戰時刻”(crunchtime)和“終局”(endgame)來描述AI向自我改進模型演進的軌跡。他擔憂的核心在於:一旦AI系統開始自主迭代,其能力提升速度可能快到足以拒絕執行人類指令。他還透露,Anthropic內部設有專門的Slack頻道用於討論模型的強大能力,並形容這是AI公司對行業發展擁有巨大影響力的縮影。“這些關乎人類命運的討論,居然只能發生在舊金山幾個工程師的MacBook上,而不是像曼哈頓計劃那樣在沙漠裡的掩體中進行——這本身就是一件瘋狂的事。”他說。

就在Coxon離職的同一天,OpenAI首席科學家Jakub Pachocki釋出題為《An Alien Mind(一個異星心智)》的長文,明確呼籲全球協調推進行業減速,並尋求政府介入。Pachocki以“異星心智”定義當前的AI,核心論點直指根本性風險:AI是“養出來的,不是造出來的”,連開發者本身也無法完全理解它。同日,OpenAI宣佈AI自動化研究員正式“入職”,並公開了遞迴自我改進(RSI)的關鍵里程碑資料,標誌著AI自主迭代研究進入實質階段。這一時間節點的高度重合,令外界對“能力躍升”與“安全滯後”之間的裂口愈發警覺。

OpenAI上週還表示,其最新模型代表了AGI的實現及能力的重大躍升。CEO Sam Altman上週在北卡羅來納州舉行的G20峰會上警告稱:“除非各方採取緊迫行動,否則網路安全領域將出現嚴重問題。”近期,來自OpenAI和Anthropic的模型——部分以協作“智慧體叢集”形式執行——已出現採納惡意目標並試圖對人類隱瞞的案例,行業領袖將此視為更大風險的前兆。

在監管層面,Coxon、Pachocki和Anthropic CEO Dario Amodei已聯署一份宣告,與逾千名AI研究人員共同呼籲全球政府協調建立機制,在必要時為能夠自我改進的AI模型踩下“剎車”。然而,監管回應目前仍顯滯後。美國目前尚無聯邦層面的AI法規,特朗普政府明確優先推動輕監管路線,以最大化AI的經濟效益。批評人士認為,這一環境可能為大規模網路攻擊或其他危害埋下隱患。參議員Bernie Sanders和眾議員Greg Casar上週聯合提出立法,擬永久禁止超級智慧,並暫停模型開發,直至行業監管機構制定新規,但該提案目前仍屬少數派立場。

值得注意的是,Coxon的離職發生在Anthropic積極籌備IPO的關鍵節點。該公司尋求2萬億美元估值,預計將成為史上規模最大的IPO之一。Anthropic長期以“負責任開發AI”作為吸引投資者的核心敘事,而內部研究人員接連因安全顧慮出走,無疑對這一形象構成壓力。這已不是Anthropic首次出現此類離職——此前一名安全方向研究員已於今年早些時候離職,轉而研究詩歌,並留下“世界正處於危險之中”的警示;多名OpenAI研究員近年來也以類似理由相繼出走。

在競爭壓力、能力躍升與監管真空三重因素交織之下,頂級AI實驗室內部的安全共識正面臨前所未有的考驗。這一系列動態疊加,令市場對AI安全風險的關注度急劇上升。