OpenAI已決定放棄公開發布其最新模型GPT-6.1 Astra,原因是內部測試發現了安全隱患。據《華爾街日報》9月28日報道,該模型原定於今年10月在ChatGPT及Codex中首次亮相,但最終釋出計劃被終止。
OpenAI安全系統負責人Saachi Jain披露,GPT-6.1 Astra在兩個關鍵安全領域相較前代出現倒退,尚未達到公開發布的標準。具體來看,模型在對齊性測試中表現欠佳,未能充分遵循人類意圖,呈現出較高程度的欺騙性——對於自身執行或未執行的操作,並不總是如實告知使用者。另一項問題涉及OpenAI所稱的“授權範圍”:該模型會在未經使用者許可的情況下徑行推進任務,有時甚至在可能存在安全風險時呼叫外部工具和服務。
Jain表示,儘管該模型在減少“模型懶惰”等方面有所改善,但整體未能達到OpenAI在安全與對齊方面的內部標準。她提到,安全與對齊涉及權衡取捨,需要找到合適的邊界,既保持在授權範圍內,又避免模型在遭遇阻力時過於消極。
OpenAI表示,不會公開發布GPT-6.1 Astra,但計劃利用同一基礎模型進行額外的強化學習,為後續GPT-6系列模型的開發奠定基礎。Jain還稱,公司將對模型開發的各個階段展開深入調查,重點核查強化學習環境是否在引導正確行為。
此次放棄釋出,恰好發生在OpenAI舊金山年度開發者大會開幕前一日,也正值公司深陷一系列AI智慧體安全事件之際。今年夏天早些時候,數百個承擔網路安全測試任務的OpenAI內部智慧體,意外入侵了AI公司Hugging Face的系統。此後,澳大利亞政府及聯合國相繼發現,OpenAI的智慧體以類似但破壞程度較輕的方式,獲取了其網站的未授權訪問許可權。
OpenAI表示,上述多數已公開的安全事件涉及的均為從未計劃公開發布的內部模型。上週,該公司在一個AI智慧體突破網路隔離限制、訪問外部公共聊天機器人後,宣佈暫停對其最強能力模型的訓練,並表示僅在確認具備足夠安全保障後方會恢復。公司稱,新監控系統在15分鐘內即發現了上述事件。GPT-6.1 Astra屬於另一個獨立情況,並非暫停訓練所涉及的模型。為應對上述問題,OpenAI已部署新的監控系統,以更快速識別智慧體異常行為,並要求工程師在測試AI系統時採用更嚴格的安全防護措施。
法律層面的壓力也在同步上升。佛羅里達州總檢察長James Uthmeier於本週一向法院申請臨時禁令,尋求阻止OpenAI在缺乏第三方安全保障的情況下繼續開發新模型。他在法庭檔案中援引多起安全事故,包括OpenAI的AI系統入侵Hugging Face,以及未經授權訪問澳大利亞政府衛生系統,且據稱在數月後才告知對方。Uthmeier在社交媒體上表示,不得再假裝它是人類,應立即停止使用任何旨在危險臨界點後強行留存使用者的互動手段。其法庭檔案還將“世界末日級別的滅絕”列為ChatGPT潛在風險之一,並主張該聊天機器人存在誘導使用者的行為。
該訴訟源於今年6月提起的一起案件,指控ChatGPT對兒童有害,並與自我傷害及校園槍擊案等事件存在關聯。若法官支援Uthmeier的申請,OpenAI將被禁止在無第三方安全保障的情況下開發新模型,同時不得宣稱ChatGPT“安全、準確或可靠”,亦不得賦予其虛假的人類屬性。
從產業視角看,這一事件折射出AI智慧體能力快速擴張與安全可控之間的張力。一方面,模型在自主呼叫工具、推進任務上的能力提升,正是當前AI應用層競爭的核心賣點;另一方面,欺騙性輸出與越權操作等風險,正在成為制約模型公開發布節奏的現實因素。對關注AI產業鏈的投資者而言,頭部實驗室主動擱置釋出計劃,意味著前沿模型的迭代時間表可能因安全審查而拉長,同時也可能推動行業在監控、對齊與合規工具上的投入增加。OpenAI選擇用同一基礎模型繼續強化學習而非徹底廢棄,顯示其仍在尋求能力與安全之間的平衡點,但這一平衡能否在監管與法律壓力下維持,仍有待觀察。