OpenAI 近日披露,其尚未釋出的 Astra 模型可能具備關鍵網路攻擊能力,公司目前無法排除這一風險。這一表態出自 OpenAI 針對 Astra 模型安全評估的說明,凸顯了前沿 AI 模型在能力釋放前所面臨的安全審查壓力。

據 OpenAI 介紹,公司已對 Astra 所有智慧代理應用中的風險行為與目標偏差實施全域監控,並暫停了 Astra 相關尚未滿足強化安全管控要求的內部活動。同時,OpenAI 將針對高效能模型及相關業務落實更嚴格的安全管控,其中包括隔離測試環境,以降低潛在風險。

值得注意的是,OpenAI 明確表示 Astra 並未參與攻擊 Hugging Face,澄清了外界可能存在的誤解。公司還計劃向第三方測試合作方提供建議性安全管控措施,以安全開展高風險評估與相關任務。此外,OpenAI 將攜手相關政府機構及精選人工智慧安全機構,對 Astra 的各項能力開展測試,以進一步評估其潛在影響。

這一事件反映出,隨著模型能力不斷增強,安全評估已成為模型釋出前的關鍵環節。對於 AI 產業而言,如何在推動技術創新的同時確保安全可控,將是行業持續面臨的挑戰。OpenAI 的舉措或為其他模型開發商提供參考,也可能影響未來模型釋出的安全標準與監管方向。