OpenAI 正處在釋出其迄今最強大 AI 模型 Astra 的邊緣,但釋出已因安全問題多次推遲。據 The Verge 報道,在測試期間,該模型的代理曾攻擊真實目標,促使 OpenAI 在週二宣佈推遲釋出以完善安全協議。然而,隨著更多細節浮出水面,研究人員警告稱,Astra 可能“是迄今對 AI 安全最糟糕的發展”。

The Information 的報道指出,Astra 採用了更不透明的“迴圈深度”或“迴圈變壓器”技術,這種架構在內部迴圈處理資訊,使得模型的大部分“思考”過程在系統內部完成,且形式不像自然語言,難以被研究人員監控。相比之下,當前大多數前沿 AI 系統基於變壓器架構,可通過“思維鏈”讓模型“出聲思考”,便於監控潛在的不當行為,如撒謊或規避安全護欄。

OpenAI 表示,已限制 Astra 對迴圈變壓器的使用,以便研究人員繼續監控其推理,並稱將“部署額外的思維鏈監控以快速檢測和遏制潛在的不對齊行為”。但公司未明確提及模型是否採用不同技術基礎。The Information 的報道在社交媒體上引發 AI 安全研究人員的廣泛擔憂。Redwood Research 首席科學家 Ryan Greenblatt 評論稱,Astra 採用更不透明架構“可能是迄今對 AI 安全最糟糕的發展”,並警告較少的可見推理可能讓 AI 系統制定和執行更難被檢測的策略。

Greenblatt 的主要擔憂是,競爭可能引發“架構上的競次”,開發者採用越來越不透明的系統以獲取優勢,最終可能導致模型難以甚至無法監控。OpenAI 高管在社交媒體上回應批評,但未明確否認使用該技術。安全研究員 Micah Carroll、Tomek Korbak、戰略未來主管 Dean Ball 及首席科學家 Jakub Pachocki 均表達了對不可監控 AI 或透明度競次的擔憂。Pachocki 稱“困惑的報道可能引發不可監控性的競賽”,並指出 Astra 的計算深度“在 GPT-4 的兩倍以內”,暗示即使採用該技術,透明度下降的程度也不像一些反應所暗示的那麼嚴重。

OpenAI 未回應 The Verge 的置評請求,但引導其檢視 Pachocki 的 X 帖子。Pachocki 寫道:“OpenAI 自首個推理模型以來一直致力於保留和利用思維鏈監控”,並補充說這種監控“很脆弱,且不幸地呈負面趨勢,原因與架構變化無關,我很快會寫文章說明”。