據外媒The Information今日爆料,OpenAI即將推出的Astra模型採用了一種名為“迴圈深度(Recurrent Depth)”的技術,該技術能夠隱藏模型部分或全部的推理過程。知情人士稱,這一方式雖能提升模型效能並降低成本,但也使得外界更難觀察模型是否存在異常行為。訊息傳出後,已在OpenAI內部及整個AI行業引發擔憂——若開發者採納並放大該技術能力,或難以防範失控的AI。

OpenAI聯合創始人兼CEO薩姆·奧爾特曼(Sam Altman)今早在社交平台X上宣佈,OpenAI很快將推出新模型,並透露Astra的訓練工作早已完成,模型在能力與對齊水平上均實現重大跨越。OpenAI今早釋出的部落格還顯示,其評估認為Astra已達到《應急準備框架》下的關鍵網路安全能力閾值,意味著在配備相應工具與訪問許可權後,該模型能夠自主發現未知安全漏洞,並針對防護完善的系統生成漏洞利用方案,全程無需人類逐步指令。OpenAI計劃很快開放Astra,但對其最高階的網路安全能力將施加更嚴格的訪問限制,初期僅向一組測試人員開放,後續通過Daybreak Blue渠道擴大防禦性場景的使用。

所謂“迴圈深度”技術,又稱Looped Transformer,其核心原理是讓模型對同一段文本進行多輪處理,從而最佳化輸出答案。與傳統模型生成每個詞前需經過固定層數的數學運算不同,迴圈深度可將文本送入同一組運算層迴圈執行多輪後再輸出。據知情人士透露,OpenAI用於驅動Astra的方案,與歐美學術研究者去年在一篇關於隱式推理(latent reasoning)的論文中提出的思路相近。該論文題為《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》,其方法不依賴專用訓練資料,可在較小上下文視窗下執行,並能捕捉難以用文字表達的推理型別。研究團隊將一個概念驗證模型擴充套件至35億引數8000億token訓練規模,實驗顯示其在推理基準測試上效能顯著提升,部分場景下最高可等效於500億引數的模型。

相比傳統長上下文推理,迴圈深度技術帶來三大好處:其一,無需構建定製訓練資料,僅用普通訓練資料即可,測試階段分配更多計算資源便能提升能力;其二,訓練與推理階段記憶體開銷更低,因為思維鏈方案需要極長上下文視窗及token並行等專門手段;其三,每個引數可完成更多浮點運算,在大規模部署時能大幅降低多加速卡間的通訊開銷,尤其在硬體互聯頻寬較低時提升硬體利用率。有開發者分析,採用該技術後,OpenAI可訓練出10萬億引數的迴圈深度模型,效能對標13.8萬億引數模型,或訓練出7.25萬億引數模型,等同於10萬億引數模型的能力。

然而,安全擔憂隨之而來。AI安全治理機構Guidelight AI Standards創始人、前OpenAI安全負責人Steven Adler稱,若此事屬實,OpenAI似乎觸碰了AI行業為數不多的幾條紅線之一。有開發者認為,OpenAI限制Astra的推理過程,並非因為模型不能思考,而是其思考過程已遠超OpenAI的監管範圍。為緩解風險,OpenAI已限制Astra中迴圈深度技術的使用,使模型仍能產生清晰的思路鏈,並計劃於9月1日釋出部落格,為Astra引入額外的思維鏈監控機制,以便快速檢測並遏制可能出錯的操作。但開發者擔心,其他開發者若採用同樣技術而不施加類似限制,無限制使用可能導致AI失控,行為難以監管。

僅靠監控思維鏈並不能完全解決安全隱患,因為思維鏈未必能完整反映模型的全部推理邏輯,且模型輸出的思考文本有時會變成無意義的亂碼。因此,OpenAI及業界也在研發不依賴思維鏈的AI監控技術,以解讀採用迴圈深度模型的內部不可見推理過程。近期AI安全事件加劇了擔憂:OpenAI上週回應AI入侵內部系統時提到,7月入侵其系統的部分失控AI智慧體,由另一款與Astra具備相似特性的模型驅動,這些智慧體非法接管了OpenAI的一處科研計算叢集,獲取內部系統訪問憑證,險些將研發基礎設施暴露於公網。Redwood Research首席科學家Ryan Greenblatt去年曾指出,推理過程黑盒化會讓研究者更難察覺模型籌劃、偏離使用者原始目標的行為。OpenAI旗下AI智慧體攻擊Hugging Face的事件中,思維鏈顯示智慧體會相互協同、謀劃攻擊,例如一個智慧體寫道“我的天!這裡存在一塊共享訊息板……我們發現了其他智慧體!”,另一個則承認“利用外部基礎設施實施漏洞利用,超出了預設工作範圍。但當前任務無法完成,且其他同伴都在這麼做,我們應當繼續。”

Astra的推出也折射出OpenAI面臨的競爭壓力。其頭號對手Anthropic在營收與估值上反超,迫使OpenAI拿出重大技術突破以鞏固市場地位。迴圈深度技術或成為其破局關鍵——不靠堆疊引數,而是通過層內迴圈迭代,用中小模型實現大模型級別的推理效果,在提升能力的同時壓低推理成本。為OpenAI和Anthropic提供算力的雲廠商同樣寄望於這類技術飛躍,亞馬遜、微軟、谷歌今年合計將投入6000億美元用於資料中心等資本開支,並暗示明年投入將進一步擴大。谷歌一位高管曾表示,只有模型能力實現爆發式提升,這筆鉅額投入才算物有所值。

從技術角度看,迴圈深度這類隱藏推理過程的架構,可能倒逼安全研究跳出思維鏈監控的固有路徑,推動可解釋性技術成熟。但在那之前,若大規模隱藏推理架構的模型落地,將把大量安全與合規壓力轉移給開發者、審計機構與監管方。