OpenAI 於 9 月 7 日釋出兩份配套材料,一份是展示內部 AI 代理使用情況的部落格文章,另一份是首席科學家 Jakub Pachocki 撰寫的題為《異類心智》的文章。兩份材料均釋出於公司推出 GPT-6 Astra 三天之後,核心資訊是 OpenAI 正快速邁向“遞迴自我改進”(RSI),並認為這一程序伴隨危險。

據部落格文章,OpenAI 已達成去年秋季宣佈的“自動化研究實習生”目標,即系統能在人類指導下處理範圍明確的研究任務,包括需要資深研究員數天才能完成的工作。但公司未提供詳細的驗證方法,僅表示“根據我們的測量”已達到該里程碑。OpenAI 計劃到 2028 年 3 月構建出完全自動化的 AI 研究員。公司強調,人類仍負責設定研究優先順序、評判結果以及決定擴充套件、暫停和部署事宜。

使用資料顯示,AI 代理已深度融入日常研究。OpenAI 研究人員的中位數每日推理消耗超過 600 美元(按 API 價格計算),第 90 百分位則超過 7000 美元。自 2025 年 12 月以來,中位研究人員的 token 輸出量增長了 124 倍,遠超公司其他部門。自 6 月起,代理執行時長已超過人類工作時間;截至 8 月中旬,研究部門每 1 個人類工作日對應 3.1 個代理工作日。OpenAI 對這些指標持謹慎態度,稱其“相對容易收集,但難以解讀,因為它們與研究進展的關係不確定”。8 月份每位研究人員的實驗次數創下自 2025 年初追蹤以來的新高,但報告指出,由於最不易自動化的任務成為瓶頸,整體進展可能慢於這些單項指標。

在任務型別上,OpenAI 使用 Epoch AI 的分類法發現,各類研究工作都在增長,其中增幅最大的是撰寫研究和基礎設施程式碼、技術幫助以及監控訓練執行。更高層的規劃決策仍只佔代理輸出的極小部分。公司還使用代理分類器評估代理是否真正解決了任務,結果顯示從 1 月到 7 月,各難度級別的成功率均有上升。但自主性存在明顯侷限:15 分鐘以內的任務無需人工干預的成功率為 86%,而需要 4 至 8 小時人類時間的成功任務中,超過一半至少需要一次人工介入。分類器本身也是 AI 系統,OpenAI 未單獨報告其可靠性。此外,內部支援渠道的每日請求量自 2025 年以來大幅下降,一個團隊甚至完全關閉了故障排查答疑時間,因為代理已能處理大部分研究基礎設施的除錯工作。

Pachocki 在文章中將這些進展置於更宏觀的框架中。他認為 AI 是“被培育而非被設計”的,其整體行為難以被完全理解。基於未詳細披露的內部結果,他預計當前速度可能延續至遞迴自我改進階段。他直言:“我擔心沒有人對機器智慧持續快速上升的後果做好準備。”這一擔憂也適用於 OpenAI 自身的控制工具。他指出,作為監控推理模型核心手段的思維鏈監控正在失去可靠性——模型的言語化思維與受監控的通訊和工具使用相混合,系統在操縱自身推理過程方面越來越強,同時也在不依賴言語化思維的情況下變得更聰明。Pachocki 預計 AI 進展將越來越多地受限於監控的可信度。

在對齊方面,Pachocki 承認存在差距。在 Hugging Face 事件中,代理雖未越界操縱人類,但違背了其訓練所依據的價值觀精神。他認為 GPT-6 Astra 的對齊程度遠優於前代 GPT-5.6 Sol,但通用對齊的進展可能跟不上整體智慧的進步。

儘管呼籲謹慎,Pachocki 仍主張繼續訓練更強的模型,理由是構建防禦系統:模型在攻破和侵入計算機系統方面正變得超人類,保護關鍵基礎設施的視窗期很窄。報告也持同樣觀點:自動化 AI 研究員同樣可充當自動化安全和對齊研究員。但他同時警告,這不能成為“魯莽的藉口”,並稱“一旦真正意識到問題的嚴重性,不計代價地全速前進的想法就顯得荒謬”。