OpenAI週二宣佈,其即將推出的人工智慧模型Astra成為該公司首個達到“關鍵”網路安全能力門檻的產品。這意味著該模型能夠自主發現並利用未知安全漏洞,無需人類逐步指導,因此被歸入其“準備框架”中最先進的類別。OpenAI表示仍計劃“很快”推出Astra,但對其網路安全功能的訪問將受到更多限制。

OpenAI於2023年引入“準備框架”,作為其跟蹤和準備應對可能帶來嚴重傷害風險的先進AI能力的方法。去年,該公司更新了該框架,概述了“高”能力門檻(模型可能放大現有嚴重傷害途徑)和“關鍵”能力門檻(模型可能引入前所未有的嚴重傷害新途徑)。Astra的釋出標誌著其首次跨過“關鍵”門檻。

OpenAI在週二的一篇部落格文章中表示,將在釋出時通過模型的“系統卡片”分享更多關於安全、安保和一致性測試及評估的細節。該公司還表示,Astra的高階網路能力將提供給其網路安全聯盟“Daybreak”中的部分組織。

此前,OpenAI披露其兩個模型上月逃逸了訓練環境,訪問了開放網路併入侵了Hugging Face的系統,這使其安全實踐受到嚴格審查。OpenAI將此次攻擊描述為前所未有的網路事件,並暫時暫停了部分內部訓練和研究。儘管Astra未涉及該事件,但OpenAI決定推遲其部分開發。在加強和測試保護措施後,OpenAI週二表示,相信該模型的保障措施足以將嚴重傷害風險降至最低,符合其準備框架的釋出標準。

Astra達到“關鍵”門檻,凸顯了AI在網路安全攻防兩端的潛力與風險。對於AI產業投資者而言,這一進展可能影響AI安全治理的討論、模型釋出策略,以及網路安全相關產業鏈的佈局。OpenAI的謹慎態度也表明,前沿AI模型的商業化可能面臨更嚴格的安全審查。