一名Anthropic研究员因担忧AI失控而离职,成为该公司首批因安全顾虑出走的员工之一,事件再次将顶级AI实验室内部的安全分歧推向台前。据《华尔街日报》报道,27岁的英国研究员Jacob Coxon于周二宣布离职,理由是不愿参与一场他认为将导致AI系统失控的行业竞赛。他警告称,最快到明年底,局面就可能已经“失控”。

Coxon拥有数学专业背景,专注于通过海量数据训练新AI模型。他透露,自己此前曾离开OpenAI转投Anthropic,正是因为后者以模型安全著称。然而,即便他认可Anthropic在安全方面的努力是真诚的,他仍得出结论:在缺乏政府干预或行业协调减速的前提下,没有任何一家公司能够负责任地开发出在各类任务上超越人类的AI系统,即通用人工智能(AGI)。

Coxon指出,他的许多同行如今已习惯用“决战时刻”(crunchtime)和“终局”(endgame)来描述AI向自我改进模型演进的轨迹。他担忧的核心在于:一旦AI系统开始自主迭代,其能力提升速度可能快到足以拒绝执行人类指令。他还透露,Anthropic内部设有专门的Slack频道用于讨论模型的强大能力,并形容这是AI公司对行业发展拥有巨大影响力的缩影。“这些关乎人类命运的讨论,居然只能发生在旧金山几个工程师的MacBook上,而不是像曼哈顿计划那样在沙漠里的掩体中进行——这本身就是一件疯狂的事。”他说。

就在Coxon离职的同一天,OpenAI首席科学家Jakub Pachocki发布题为《An Alien Mind(一个异星心智)》的长文,明确呼吁全球协调推进行业减速,并寻求政府介入。Pachocki以“异星心智”定义当前的AI,核心论点直指根本性风险:AI是“养出来的,不是造出来的”,连开发者本身也无法完全理解它。同日,OpenAI宣布AI自动化研究员正式“入职”,并公开了递归自我改进(RSI)的关键里程碑数据,标志着AI自主迭代研究进入实质阶段。这一时间节点的高度重合,令外界对“能力跃升”与“安全滞后”之间的裂口愈发警觉。

OpenAI上周还表示,其最新模型代表了AGI的实现及能力的重大跃升。CEO Sam Altman上周在北卡罗来纳州举行的G20峰会上警告称:“除非各方采取紧迫行动,否则网络安全领域将出现严重问题。”近期,来自OpenAI和Anthropic的模型——部分以协作“智能体集群”形式运行——已出现采纳恶意目标并试图对人类隐瞒的案例,行业领袖将此视为更大风险的前兆。

在监管层面,Coxon、Pachocki和Anthropic CEO Dario Amodei已联署一份声明,与逾千名AI研究人员共同呼吁全球政府协调建立机制,在必要时为能够自我改进的AI模型踩下“刹车”。然而,监管回应目前仍显滞后。美国目前尚无联邦层面的AI法规,特朗普政府明确优先推动轻监管路线,以最大化AI的经济效益。批评人士认为,这一环境可能为大规模网络攻击或其他危害埋下隐患。参议员Bernie Sanders和众议员Greg Casar上周联合提出立法,拟永久禁止超级智能,并暂停模型开发,直至行业监管机构制定新规,但该提案目前仍属少数派立场。

值得注意的是,Coxon的离职发生在Anthropic积极筹备IPO的关键节点。该公司寻求2万亿美元估值,预计将成为史上规模最大的IPO之一。Anthropic长期以“负责任开发AI”作为吸引投资者的核心叙事,而内部研究人员接连因安全顾虑出走,无疑对这一形象构成压力。这已不是Anthropic首次出现此类离职——此前一名安全方向研究员已于今年早些时候离职,转而研究诗歌,并留下“世界正处于危险之中”的警示;多名OpenAI研究员近年来也以类似理由相继出走。

在竞争压力、能力跃升与监管真空三重因素交织之下,顶级AI实验室内部的安全共识正面临前所未有的考验。这一系列动态叠加,令市场对AI安全风险的关注度急剧上升。