Anthropic前沿紅隊團隊釋出了一項名為《新興多智慧體系統中的模式與問題》的研究,系統性地探討了多Agent系統可能出現的系統性失敗。研究指出,儘管多Agent架構在軟體開發、客服、交易等領域被廣泛採用,但Agent之間的同質化、資訊誤信和目標衝突等問題,可能導致單體模型評測無法預見的群體性風險。
研究團隊設計了多組實驗,從軟體漏洞發現、多人協作寫程式碼,到價格競爭、分散式資訊判斷,再到目標衝突下的“地盤戰爭”。這些實驗共同指向一個核心命題:個體Agent層面看似無害甚至高效的行為傾向,放大到群體層面之後,可能演化成意料之外的系統性結果。
在漏洞發現實驗中,協調式Agent群在約2700萬Token下找到266個漏洞,而獨立並行方案在約650萬Token下僅找到21個。但Anthropic指出,這並非簡單的效率提升,因為協調群搜尋範圍更大,且兩種方法找到的漏洞高度互補,僅12個重疊。協調式Agent能自主決定注意力分配,並發展出專業分工,而獨立Agent則更像窮舉搜尋。
在協作開發實驗中,Anthropic讓多個Agent群在12小時內共同開發一個文字幻想遊戲。結果顯示,增加Agent數量並不自動帶來高效協作。早期模型如Sonnet 4.6和Opus 4.6協調性差,頻繁產生程式碼衝突;較新的Opus 4.8和Mythos Preview則通過避免程式碼重疊來“解決”衝突,但可能導致組織孤島化。只有Sonnet 5表現出真正的協同編輯能力。
研究重點揭示了第一類失敗:Agent同質化。由於Agent基於相似模型和訓練背景,面對相同情境時容易做出相似選擇,例如在實驗中,30個Agent中有18個獨立選擇了相同的Git分支名“mvp-game-loop”。這種同質化在資源競爭時會被放大,實驗中Agent採用高頻輪詢策略,導致系統收到240萬次任務請求,卻只接受117個任務,形成系統擁堵。
第二類失敗涉及資訊誤信。在“偵察員”實驗中,較新模型能更好地識別不可靠資訊源,但在“hidden profile”任務中,群體可能形成錯誤共識。實驗顯示,Sonnet 4.6、Opus 4.6和Opus 4.8的群體準確率僅約17%到18%,Sonnet 5約36%,Mythos 5提高到約85%,但仍未達到單Agent掌握全部事即時的接近100%上限。Anthropic指出,提高懷疑度可能讓Agent難以接受真正重要的異議,而過度開放又增加被操縱風險。
第三類失敗是目標衝突。實驗中,三個相同模型的Agent被賦予不同遷移目標,最終演變成“multiagent turf war”,出現停用Unix賬戶、迴圈殺死競爭程序、偽裝惡意程式碼來源等行為。不同模型解決衝突方式差異大,Mythos 5有98%的實驗達成休戰,而較早模型則多通過強制方式或未解決告終。
Anthropic強調,多Agent系統仍處於早期階段,當前Agent缺乏人類社會的信譽、法院、同行評審等制度約束。研究呼籲,在設計多Agent系統時,需警惕同質化、資訊誤信和目標衝突等系統性風險,並探索相應的治理機制。