賓夕法尼亞大學沃頓商學院副教授 Edgar Dobriban 藉助 OpenAI 的最新語言模型 GPT-5.6 Sol Pro,在約 90 分鐘內成功推翻了一個困擾統計學界長達 30 年的核心猜想。這一猜想涉及廣泛應用的 Benjamini-Hochberg(BH)方法,該方法自 1995 年由統計學家 Yoav Benjamini 和 Yosef Hochberg 提出以來,已成為控制多重假設檢驗中錯誤發現率(FDR)的基石工具,原始論文被引用超過 13 萬次

該猜想假定,即便在資料存在相關性且服從正態分佈的情況下,BH 方法仍能可靠地將錯誤發現率控制在目標水平之下。長期以來,學界預設這一假設成立,但始終未能給出嚴格證明。Dobriban 在預印本論文中展示瞭如何利用 AI 構建出一個反例統計模型,在該模型中,實際的錯誤發現率可證明地超過了目標水平(0.104 對比 0.1),模擬實驗也驗證了這一結果。

值得注意的是,前代模型 GPT-5.5 在多個智慧體協作執行超過 20 小時後仍未能找到有效解決方案,而 GPT-5.6 Sol Pro 僅用 90 分鐘便完成了任務。Dobriban 本人評價稱,這一能力提升是“相當真實”的。

從產業與科研視角看,這一突破的意義更多體現在理論層面。Dobriban 指出,實際偏差“相對較小”,目前該發現並不意味 BH 方法在實踐中不可用,其實際影響仍需進一步研究。然而,它對 AI 能力邊界的討論提供了新彈藥。伯克利統計學家 Will Fithian 將這一被推翻的猜想稱為“我所在統計學領域最有趣的開放問題”,並將該成果視為“AI 能力進步的又一標誌,其影響將遠超數學領域”。

該事件也再次點燃了關於 AI 創造力本質的辯論。據 Dobriban 描述,模型的解決方案並非憑空創造出全新理論,而是以一種“不尋常”的方式組合了已知方法。這恰好觸及一個更大的未解問題:基於人類資料訓練的模型,究竟是能推理出真正的新知識,還是“僅僅”在重組訓練中所學的內容?深度學習先驅 Richard Sutton 等人傾向於認為,要實現能自我改進和泛化的 AI,可能需要超越這種重組能力,他近期已為此創立了初創公司。

儘管如此,即便 AI 的能力邊界目前仍停留在高效重組已知資訊,其作為嵌入人類科研工作流的日常工具,價值已不容小覷。Dobriban 的案例為這一日益增長的例證清單增添了濃重一筆,同時也讓部分學者對自身工作的獨特性產生了複雜情緒。Fithian 坦言:“我忍不住懷念那些逝去的日子,那時一項關鍵成果總意味著有一位同事值得慶祝,一種人類洞見值得欽佩,一項人類成就值得被激勵。”