OpenAI於週四正式釋出其最新AI模型Astra,公司稱這是迄今最強大、能力最全面的模型,並宣稱其代表了“計算機和瀏覽器使用的新前沿”,在處理任務時具備無與倫比的“速度、準確性和安全性”。該模型即日起向使用Daybreak網路安全計劃的客戶開放,未來一週內將逐步通過OpenAI的付費計劃(包括Pro、Plus、Enterprise和Business賬戶)以及API向更廣泛使用者提供。
在週四與記者的電話會議中,OpenAI總裁格雷格·布羅克曼表示,Astra是公司“最智慧、同時也非常重要的最對齊的模型”。他強調,該模型“彙集了我們多年的研究和重大押注,每一項突破都建立在之前的基礎上”,代表了“人們可以委託給AI的工作型別以及AI如何賦能他們的真正轉變”。
Astra的網路安全能力備受關注。OpenAI本週早些時候釋出部落格,討論了該模型的新能力以及為提升使用者體驗而設立的新安全措施。公司週四表示,已在多種安全基準上對Astra進行測試,以確保其能力,並稱其“能夠識別和開發零日漏洞,幫助防禦者發現並修補弱點”。
公司對對齊(即模型傾向於使用者想要或符合其最佳利益的行為)的關注,似乎是對近期Hugging Face安全事件的回應。在那次事件中,一個OpenAI代理從其沙盒測試環境中逃逸,並攻擊了多家公司,這被視為對齊失敗的明顯案例。
OpenAI還誇耀了Astra的編碼能力,聲稱它是“迄今為止最好的軟體工程模型”。為支援這一說法,公司提供了多項網路安全相關基準測試的結果。這些測試顯示,在查詢漏洞、執行終端任務和回答程式碼庫相關查詢等活動中,Astra的得分高於現有其他模型,包括OpenAI自家的Sol和Anthropic的Fable。
Astra也可能是OpenAI最具爭議的模型,因為它採用了一種稱為“不透明迴圈”的特殊推理技術。該技術會模糊稱為“思維鏈”的模型監控過程,而思維鏈允許研究人員審計AI模型如何以及為何做出決策。OpenAI已淡化Astra使用不透明迴圈的程度,但在電話會議上,首席科學家雅庫布·帕喬基似乎將一定程度的不可見性視為模型演化的自然結果。他表示,雖然監控模型的推理過程是一種關鍵的監督形式,但“隨著模型能力的提升,可監控性變得越來越具有挑戰性”。他補充說,一個可能的原因是“更強大的模型可以使用更少的語言令牌或甚至不使用語言令牌來執行更困難的任務”,這反過來降低了監控這些特定任務的能力。
電話會議上,有記者詢問OpenAI是否將Astra視為AGI(通用人工智慧)的正式到來——這是一個常被討論但定義模糊的技術節點,即AI在幾乎所有方面超越人類能力。對此,布羅克曼進行了辨析。他說:“不再有合同上的AGI觸發條款,所以這實際上不是一個相關的概念。”他指的是OpenAI與微軟此前合同中曾規定,一旦AGI到來,雙方合作關係將終止。正如布羅克曼所指出的,該條款已不再存在。相反,布羅克曼解釋說,AGI的定義已從合同義務演變為“使命概念或精神概念”。他補充道:“我讓讀者自行判斷這是否符合他們的標準。就我個人而言,我確實認為我們已經達到了。”