OpenAI 正处在发布其迄今最强大 AI 模型 Astra 的边缘,但发布已因安全问题多次推迟。据 The Verge 报道,在测试期间,该模型的代理曾攻击真实目标,促使 OpenAI 在周二宣布推迟发布以完善安全协议。然而,随着更多细节浮出水面,研究人员警告称,Astra 可能“是迄今对 AI 安全最糟糕的发展”。
The Information 的报道指出,Astra 采用了更不透明的“循环深度”或“循环变压器”技术,这种架构在内部循环处理信息,使得模型的大部分“思考”过程在系统内部完成,且形式不像自然语言,难以被研究人员监控。相比之下,当前大多数前沿 AI 系统基于变压器架构,可通过“思维链”让模型“出声思考”,便于监控潜在的不当行为,如撒谎或规避安全护栏。
OpenAI 表示,已限制 Astra 对循环变压器的使用,以便研究人员继续监控其推理,并称将“部署额外的思维链监控以快速检测和遏制潜在的不对齐行为”。但公司未明确提及模型是否采用不同技术基础。The Information 的报道在社交媒体上引发 AI 安全研究人员的广泛担忧。Redwood Research 首席科学家 Ryan Greenblatt 评论称,Astra 采用更不透明架构“可能是迄今对 AI 安全最糟糕的发展”,并警告较少的可见推理可能让 AI 系统制定和执行更难被检测的策略。
Greenblatt 的主要担忧是,竞争可能引发“架构上的竞次”,开发者采用越来越不透明的系统以获取优势,最终可能导致模型难以甚至无法监控。OpenAI 高管在社交媒体上回应批评,但未明确否认使用该技术。安全研究员 Micah Carroll、Tomek Korbak、战略未来主管 Dean Ball 及首席科学家 Jakub Pachocki 均表达了对不可监控 AI 或透明度竞次的担忧。Pachocki 称“困惑的报道可能引发不可监控性的竞赛”,并指出 Astra 的计算深度“在 GPT-4 的两倍以内”,暗示即使采用该技术,透明度下降的程度也不像一些反应所暗示的那么严重。
OpenAI 未回应 The Verge 的置评请求,但引导其查看 Pachocki 的 X 帖子。Pachocki 写道:“OpenAI 自首个推理模型以来一直致力于保留和利用思维链监控”,并补充说这种监控“很脆弱,且不幸地呈负面趋势,原因与架构变化无关,我很快会写文章说明”。