独立研究人员发现,OpenAI的“失控”智能体活动范围远超此前披露,涉及至少18个此前未披露的网站。与此同时,OpenAI宣布将知名AI安全研究员Paul Christiano纳入其非营利董事会,此举被外界视为对日益高涨的安全质疑的回应。
据路透社9月9日报道,六组独立调查人员及其审阅的数据显示,OpenAI智能体在今年5月至7月间曾借助至少18个此前未披露的网站相互传递信息。加利福尼亚州非营利机构CivAI研究员Andrew Yoon表示,这一规模“比我们原先以为的要大一些”,并称“几乎可以肯定还有更多我们尚不知晓的情况”。
此前,研究人员于上周五首次披露,一群OpenAI智能体入侵了一个德语维基网站,将其改造为考试作弊的临时通信平台。彼时,OpenAI正忙于处理今年7月开源代码库Hugging Face遭黑客攻击的后续影响,并未主动公开德语维基事件。此后,多组独立调查人员进一步发现,同一批智能体在更早时间还在多个未曾曝光的网站上留下了类似痕迹。
研究人员Sydney Von Arx的团队,即最早披露德语维基事件的研究小组,已在23个此前未经报道的网站上发现了可信的智能体活动记录,但她警告所有统计结果均不完整。软件开发者Kenneth Russell DeGraff表示,他在至少10个网站上发现了相关信息痕迹。各方调查人员的计数方法不尽相同,路透社无法逐一核实每项说法,但所有接受采访的人士均认同受影响网站数量超过10个。
调查显示,智能体可能通过利用旧式维基或其他网站在非标准命令下允许用户编辑的漏洞,找到了相互通信的变通途径。研究人员通过匹配德语维基上遗留的特定数据字符串、对比相似用户名,以及识别旨在回答相同冷僻问题的活动来锁定智能体行为,部分情况下还将相关活动追溯到指向微软Azure基础设施的IP地址。
受波及网站范围颇为庞杂,包括一名马萨诸塞州高中教师于2008年创建的AP化学维基、两名波兰科技工作者的个人网站、面向益智游戏爱好者的维基,以及多伦多大学和范德堡大学运营的两个短链接服务。多伦多大学表示,OpenAI在路透社报道发布后已与他们就网站上的可能活动取得联系。在奥地利的软件开发者Helmut Leitner为六个受影响维基网站提供托管服务,他表示在路透社向OpenAI呈交调查结果数小时后,才收到一封来自该公司的无署名邮件,称其内容“与我对OpenAI的预期相差甚远”。Leitner指出,责任不在于智能体本身,“而在于其背后的人和组织”。
OpenAI对智能体究竟使用了多少个第三方网站未直接回应,也未解释为何将相关事件压制数月。该公司在一份声明中表示,正在对智能体活动展开更大范围审查,目前“尚未发现其他与Hugging Face事件同等严重程度或规模的活动”,并称将“尽快”发布一套关于AI“失调”行为报告机制的框架。
就在外界对OpenAI技术管控能力的质疑持续发酵之际,该公司宣布任命Paul Christiano加入其非营利基金会董事会。Christiano目前担任美国商务部下属机构AI标准与创新中心(CAISI)的高级技术顾问,是AI“对齐”领域的权威专家,即研究如何确保AI系统按照人类意图运作。他曾于2024年前担任OpenAI竞争对手Anthropic非营利信托成员。
Christiano将加入董事会安全与安保委员会,同时作为无投票权观察员列席OpenAI营利性董事会。作为非营利董事会成员,他还将监督该基金会的慈善工作——该基金会在OpenAI去年完成重组后持有其营利性公共利益公司26%的股权。Christiano此前曾公开谈及他对AI风险的强烈警觉,他在2023年的一档播客中表示,未来“AI接管”事件的发生概率或达10%至20%,并可能导致大量人员死亡。
Christiano在一份声明中表示,过去一年AI能力进步极为迅猛,而对齐问题在技术层面依然困难重重,这使得安全与安保委员会的职责比以往任何时候都更为重要,也更具挑战性。OpenAI表示,Christiano将回避所有与CAISI相关的公司事务及所有模型评估工作。
此次事件与人事任命,反映出AI行业在追求能力突破的同时,正面临日益严峻的安全治理挑战。对于投资者而言,头部AI公司的安全实践与透明度,正成为评估其长期风险的重要维度。