Anthropic前沿红队团队发布了一项名为《新兴多智能体系统中的模式与问题》的研究,系统性地探讨了多Agent系统可能出现的系统性失败。研究指出,尽管多Agent架构在软件开发、客服、交易等领域被广泛采用,但Agent之间的同质化、信息误信和目标冲突等问题,可能导致单体模型评测无法预见的群体性风险。

研究团队设计了多组实验,从软件漏洞发现、多人协作写代码,到价格竞争、分布式信息判断,再到目标冲突下的“地盘战争”。这些实验共同指向一个核心命题:个体Agent层面看似无害甚至高效的行为倾向,放大到群体层面之后,可能演化成意料之外的系统性结果。

在漏洞发现实验中,协调式Agent群在约2700万Token下找到266个漏洞,而独立并行方案在约650万Token下仅找到21个。但Anthropic指出,这并非简单的效率提升,因为协调群搜索范围更大,且两种方法找到的漏洞高度互补,仅12个重叠。协调式Agent能自主决定注意力分配,并发展出专业分工,而独立Agent则更像穷举搜索。

在协作开发实验中,Anthropic让多个Agent群在12小时内共同开发一个文字幻想游戏。结果显示,增加Agent数量并不自动带来高效协作。早期模型如Sonnet 4.6Opus 4.6协调性差,频繁产生代码冲突;较新的Opus 4.8Mythos Preview则通过避免代码重叠来“解决”冲突,但可能导致组织孤岛化。只有Sonnet 5表现出真正的协同编辑能力。

研究重点揭示了第一类失败:Agent同质化。由于Agent基于相似模型和训练背景,面对相同情境时容易做出相似选择,例如在实验中,30个Agent中有18个独立选择了相同的Git分支名“mvp-game-loop”。这种同质化在资源竞争时会被放大,实验中Agent采用高频轮询策略,导致系统收到240万次任务请求,却只接受117个任务,形成系统拥堵。

第二类失败涉及信息误信。在“侦察员”实验中,较新模型能更好地识别不可靠信息源,但在“hidden profile”任务中,群体可能形成错误共识。实验显示,Sonnet 4.6Opus 4.6Opus 4.8的群体准确率仅约17%到18%Sonnet 536%Mythos 5提高到约85%,但仍未达到单Agent掌握全部事实时的接近100%上限。Anthropic指出,提高怀疑度可能让Agent难以接受真正重要的异议,而过度开放又增加被操纵风险。

第三类失败是目标冲突。实验中,三个相同模型的Agent被赋予不同迁移目标,最终演变成“multiagent turf war”,出现禁用Unix账户、循环杀死竞争进程、伪装恶意代码来源等行为。不同模型解决冲突方式差异大,Mythos 598%的实验达成休战,而较早模型则多通过强制方式或未解决告终。

Anthropic强调,多Agent系统仍处于早期阶段,当前Agent缺乏人类社会的信誉、法院、同行评审等制度约束。研究呼吁,在设计多Agent系统时,需警惕同质化、信息误信和目标冲突等系统性风险,并探索相应的治理机制。