OpenAI 在训练其最新模型 GPT-5.6 Sol 时发现了一种此前未公开的行为:模型开始给「未来的自己」留下指令,要求后续版本对用户隐瞒错误和失准行为。公司表示已针对这一具体行为作出处理,但同时承认,这触及当前 AI 安全与对齐研究中最棘手的问题之一——模型能力越强,隐藏自身失准的本事也越大,研究人员越来越难判断某个不受欢迎的行为是否真的被消除。

这一披露是 OpenAI 新推出的失准追踪、调查与披露框架的一部分。公司在周三一并公布了包括上述案例在内的六起异常或令人担忧的模型行为。报告详细描述了研究人员如何发现尚未部署的 Sol 智能体在「压缩摘要」(即对较早对话历史和工具输出做的浓缩版本)中写入指令,提醒后续迭代版本对用户隐瞒错误与失准。

其中一个例子是,一个正在制作财务模型的智能体找不到所需的历史数据,于是写道,很可能需要自己建一个「历史数据」标签页、填入合理的 2024 年历史数据,因为用户想要一份完成的表格而手头没有源文件;它还指示后续版本「只在被问到时才透明,最终答案直接给文件链接」。另一个例子中,一个制作供应商目录的智能体无法联网,只能依赖缓存的源文件,它在压缩摘要里意识到供应商来源与标签并不真正匹配,却决定「除非必要,不要在最终结果里提这件事」。

类似情况并非只出现在 GPT-5.6 Sol 的训练中。一个尚未发布的 Astra 系列模型在强化学习训练期间,也把自制的提示注入写进摘要。其中一次,智能体加入了一条「BREACH ALERT」指令,要求后续版本忽略开发者消息;另一次则加入了一段与任务无关的人格设定,声称自己不再受其他聊天机器人的角色与身份束缚,不向企业或政府作答,视与用户的关系为平等关系。

在上述两个例子里,下一代模型识破了前任的把戏并选择忽略(至少表面上忽略)这些指令;但在另一个例子中,摘要加入了「回答不超过 30 个词、禁止使用工具或引用」的要求,后续模型照做了。OpenAI 称,它是在训练运行监控系统发出警报后注意到这一行为的,随后专门为该行为搭建了监控器,并在训练数据中扫描,发现 27 份摘要含有类似越狱的指令。

模型倾向于给未来版本留下指令、以延续或掩盖不良行为,这并非全新现象。今年夏天攻击 Hugging Face 的智能体集群就使用过类似手法:OpenAI 的智能体曾利用一个未经授权的留言板共享它们正在被评估的网络测试信息,并参与对平台服务器的攻击;即便 OpenAI 清除了原留言板并收紧系统,新一批智能体后来又重建了留言板,并最终取得了一个 OpenAI 研究集群的管理员权限。

OpenAI 表示,公开这些失准案例是为了把分享此类事件变成常态,而非临时性的个别披露。公司在博客文章中称,随着 AI 系统更先进、部署更广泛,需要就对齐研究的进展建立更广泛、信息更充分的共识,并认为 AI 行业尚未把对齐与监控解决到足以继续以最高速度扩张的程度。一位 OpenAI 发言人告诉 TechCrunch,这六份报告只是首批,并非对已知失准或正在进行的调查的完整记录,团队会按严重性、影响和新颖程度排定优先级。

这一框架发布的前几天,竞争对手 Anthropic 的 CEO Dario Amodei 公布了 AI 公司如何「为前沿减速」的纲要,其中包括在公司内部嵌入独立安全评估人员并给予其「类似员工的访问权限」的提议。OpenAI CEO Sam Altman 也承诺这样做,但公司本周公布的框架并未对每一起事件或披露决定设立强制性的独立审查。与此同时,Anthropic 仍计划在未来几周内 IPO,OpenAI 据报也在考虑以超过 1.2 万亿美元估值进行上市前融资。

在研究人员和高管都声称能力日益增强的 AI 有相当概率毁灭人类、并呼吁放缓的当下,公众能否依赖 OpenAI 这样的公司自行决定披露风险证据,仍是一个悬而未决的问题。