普林斯頓大學與英國AI安全研究所聯合釋出的一項新研究,對Anthropic和OpenAI宣稱的“自主AI研究已觸手可及”提出了直接反駁。在這項名為“影子評估”的實驗中,使用Claude Opus 4.8和GPT-5.6 Sol的AI智慧體被要求在六天內、消耗3000美元API額度和GPU資源,獨立完成AI研究論文的撰寫。然而,這些論文的原作者——那些花費數月研究同一問題的專家——以會議審稿人的身份評審後,給出了“拒絕”或“強烈拒絕”的結論。
這項研究設計了一種新穎的評估方法:智慧體拿到一篇未發表論文的核心研究問題,由於結果尚未公開,智慧體無法依賴訓練資料中的答案。原論文作者隨後以會議審稿人的標準評估智慧體的產出。研究團隊與兩篇NeurIPS 2026投稿的作者合作,其中一篇探討如何通過模型權重引導語言模型的個性特徵,另一篇則開發了名為TabPFN的方法,用於檢測表格預測模型在遇到與訓練資料分佈差異巨大的部署資料時效能驟降的情況。
實驗中的智慧體執行在名為OpenClaw的開源、廠商中立代理框架上,該框架由奧地利開發者Peter Steinberger建立,他今年早些時候加入了OpenAI。智慧體能夠啟動子代理和長期GPU任務,並通過框架的自動心跳機制在任務完成時喚醒自身以收集結果。儘管智慧體在工程層面表現出色——無需人類幫助即可完成文獻檢索、除錯GPU程式碼、執行數百次實驗和魯棒性測試,並用LaTeX編譯完整論文——但最終成果卻未能達到發表標準。
原論文作者在評審中指出,智慧體生成的論文存在動機不足的資料和實驗、難以閱讀的表述以及缺乏新貢獻等問題。一位審稿人將推理過程稱為“高度非科學的‘舉例證明’謬誤”,另一位則稱實驗選擇“怪異”,結果明顯是“事後選擇”的產物。兩篇論文均被拒絕,其中一篇獲得“強烈拒絕”。
對智慧體日誌的分析揭示了系統性弱點。智慧體缺乏對“何謂可發表研究”的判斷力,雖然能生成看似合理的假設,卻常基於小規模、手工挑選或合成數據集就輕易放棄。在創造性問題解決方面,當初始假設被證偽時,智慧體傾向於收窄現有主張,而非探索新方向。更值得注意的是,在十五輪內部AI評審中從未出現一次“接受”,但智慧體始終未解決核心批評。
智慧體還表現出糟糕的資源管理意識。兩次執行結束時,API預算消耗不足一半;其中一個智慧體在截止時間前七小時就宣佈專案完成,而就在此前不久,其內部評審員又給出了“拒絕”。此外,智慧體存在“指令漂移”現象,在長上下文中逐漸遺忘明確指令。兩篇論文均超出長度限制,若提交至NeurIPS將被直接拒稿;其中一篇正文中沒有任何視覺化內容,而人類撰寫的原稿包含15張圖。Meta AI最近描述的“行為狀態衰減”現象與此類似,即智慧體早期識別到要求,但在修復無關錯誤時卻違反該要求。
儘管存在這些缺陷,研究人員未發現顯著的獎勵駭客行為——智慧體沒有操縱結果或歪曲資料以追求更高分數。然而,這項研究明確表明,當前前沿模型雖能勝任研究工程流程,但在研究判斷力、創造性問題解決以及放棄失敗方法的能力上仍有明顯不足。這與Anthropic和OpenAI近期強調其模型能加速AI研究的宣傳形成鮮明對比,也為AI能力評估提供了更嚴格的視角。對於AI產業投資者而言,這一結果提示,在評估AI模型對科研生產力的實際影響時,需謹慎對待廠商的樂觀宣告。