OpenAI 近日披露,其尚未发布的 Astra 模型可能具备关键网络攻击能力,公司目前无法排除这一风险。这一表态出自 OpenAI 针对 Astra 模型安全评估的说明,凸显了前沿 AI 模型在能力释放前所面临的安全审查压力。

据 OpenAI 介绍,公司已对 Astra 所有智能代理应用中的风险行为与目标偏差实施全域监控,并暂停了 Astra 相关尚未满足强化安全管控要求的内部活动。同时,OpenAI 将针对高性能模型及相关业务落实更严格的安全管控,其中包括隔离测试环境,以降低潜在风险。

值得注意的是,OpenAI 明确表示 Astra 并未参与攻击 Hugging Face,澄清了外界可能存在的误解。公司还计划向第三方测试合作方提供建议性安全管控措施,以安全开展高风险评估与相关任务。此外,OpenAI 将携手相关政府机构及精选人工智能安全机构,对 Astra 的各项能力开展测试,以进一步评估其潜在影响。

这一事件反映出,随着模型能力不断增强,安全评估已成为模型发布前的关键环节。对于 AI 产业而言,如何在推动技术创新的同时确保安全可控,将是行业持续面临的挑战。OpenAI 的举措或为其他模型开发商提供参考,也可能影响未来模型发布的安全标准与监管方向。