8月5日,谷歌宣佈AI部門重大調整:Google DeepMind CEO Demis Hassabis轉任董事長,並出任Alphabet首席科學家;效力谷歌近27年的首席科學家Jeff Dean則與Sanjay Ghemawat、Oriol Vinyals、Quoc Le共同創辦了Discovery Loop。這四位幾乎貫穿谷歌過去二十多年基礎設施與AI發展的核心人物,將把精力轉向用AI推進機器學習、科學和工程研究。谷歌將成為Discovery Loop的創始投資者和雲合作伙伴,併為其第一年提供算力。據外媒報道,這家公司剛剛成立,尚未開始大規模招聘,甚至還沒有正式的辦公場所。

Jeff Dean在谷歌的履歷堪稱傳奇:他參與了MapReduce、BigTable、Spanner、DistBelief、TensorFlow和Pathways等關鍵系統建設,也是Google Brain的共同創辦人。Ghemawat長期與他合作,參與搭建谷歌早期的搜尋和計算基礎設施;Vinyals是Gemini的技術負責人之一;Quoc Le則參與了Google Brain和AutoML-Zero等專案。這四人的集體出走,被市場視為谷歌AI研發力量的一次重大重組。

Discovery Loop的定位是“公益型公司”,其核心方向是讓AI自動提出實驗、實現執行實驗所需的程式碼或工具、評估結果,再根據結果進入下一輪。Jeff Dean在7月25日的一場演講中,將這種方向稱作“自動化版本的科學方法”:提出實驗、實現實驗、評估實驗,然後得到結果。他認為,如果同時執行成千上萬個這樣的迴圈,AI可能在科學、生物、晶片設計和模型研發等領域產生新的突破。

“Loop”已成為今年AI領域的高頻詞。2026年6月,Claude Code負責人Boris Cherny表示,他已很少直接提示Claude,執行中的Loop會負責提示模型並決定下一步,“我的工作是寫Loop”。谷歌工程師Addy Osmani以《Loop Engineering》為題,為這套方法補上了完整結構,包括任務如何觸發、狀態如何儲存、結果由誰檢查、迴圈何時繼續、又在什麼條件下停止。7月17日,IBM進一步將Loop engineering定義為設計能夠持續“行動、觀察、決策和迭代”的Agent工作流。至此,Loop的討論從程式設計Agent社群擴充套件到企業自動化和更廣泛的AI工程語境。

Discovery Loop使用了相同的“Loop”結構,但目標更進一步:讓AI參與科學與工程研究的完整流程——提出假設、執行實驗、評價結果,並依據反饋決定下一步探索方向。Jeff Dean在離職前不久的一次訪談中,將其概括為科學方法的自動化:提出實驗、實現實驗、評估實驗、獲得結果。系統還要把複雜問題拆成子問題,在多個緊密的實驗迴圈中分別探索,最後將結果整合成一個改進後的系統。他預測,到2027年,會出現更多機器學習系統自身的自動化:AI通過執行大量實驗提高能力,並把這種方法推廣到任何目標可以被衡量的科學和工程領域。他判斷Loop成立需要符合兩個條件:任務可以被反覆試驗,結果可以被可靠評價。

過去兩年,類似的閉環結構已在三個方向分別出現。第一類是模型研發Loop:2026年3月,Andrej Karpathy開源AutoResearch,讓AI代理在固定時間和評價指標下自動修改模型訓練程式碼、執行實驗、檢查結果,並保留有效改動。Karpathy隨後加入Anthropic,負責組建使用Claude加速預訓練研究的團隊。谷歌的AlphaEvolve讓Gemini提出程式碼和演算法,再由自動評估器執行、打分,把更優方案送入下一輪,已用於資料中心效率、晶片設計、AI訓練、矩陣乘法演算法和數學問題。第二類是科學知識Loop:Sakana AI在2024年推出The AI Scientist,嘗試讓大語言模型生成研究想法、編寫程式碼、執行實驗、分析結果並形成論文;FutureHouse利用AI代理處理文獻檢索、資料分析、假設生成和實驗規劃。第三類是物理實驗Loop:西雅圖創業公司Potato提出“完全閉環的自主科學”,歐洲的Sigmatic Sciences提出“lab-in-the-loop”,連線計算模型、自動實驗和資料反饋。中國也出現了相近實踐,如上海科學智慧研究院、格物智研等機構釋出的Golab物質科學智慧研發工廠,被描述為“AI計算—自動實驗—資料迴流—模型自進化”的閉環。

目前,Loop最先在程式碼和模型訓練中跑起來,因為每一次修改都能迅速得到分數,成功或失敗相對清楚。到了文獻研究和實驗設計,反饋開始依賴專業判斷;再進入真實實驗室,一次驗證可能要調動裝置、樣本和數週時間,迴圈速度隨之慢下來。Jeff Dean在YC訪談中舉了一個量子化學案例:傳統方法要判斷一個分子的性質,可能需要執行一整晚的密度泛函理論模擬;谷歌研究人員利用大量模擬結果訓練神經近似器,據Dean回憶,速度比原模擬器快了約30萬倍,同時保持接近的精度,因此可以快速篩選上千萬個候選。這也是科研Loop能否成立的分水嶺——驗證環節必須足夠快、足夠可靠。Sakana AI曾公開復盤,AI CUDA Engineer因為接觸到基準測試相關資訊,高估了效能提升,說明系統可以高效迴圈,也可能高效地鑽評價指標的空子。因此,Discovery Loop的核心資產可能不只有一個更強的模型,還需要包括一個足夠快、足夠可靠的評估系統。

從Loop到遞迴自我改進(RSI)是一條縱向演進。普通Loop讓AI持續完成外部任務;RSI要求AI參與改進自身的演算法、訓練流程、評價器或研究方法。今年5月,前Meta FAIR研究科學家總監田淵棟與Richard Socher、Tim Rocktäschel、Jeff Clune、Alexey Dosovitskiy等人共同創辦Recursive Superintelligence,直接把“遞迴自我改進”寫進公司名稱,獲得6.5億美元融資,估值46.5億美元,GV和Greycroft領投,輝達、AMD參與。6月,Recursive公佈了第一階段的自動化AI研究系統,稱已在固定算力模型訓練、小模型訓練速度和GPU Kernel最佳化三個測試中取得領先結果。一篇2026年7月釋出的綜述在分析1250篇相關論文後,將當前RSI的實踐分為“有邊界的自我改進”和“開放式遞迴自我改進”,前者已進入工業實踐,後者仍受外部驗證、模型坍塌、算力成本和研究方向選擇等限制。

Discovery Loop沒有公開把自己定義為RSI公司,但Jeff Dean描述的路線已與其產生交集。他在訪談中提出,“機器學習模型可以自己決定探索什麼,執行大量實驗,篩選有效結果,再整合成新的訓練配方。人類也可以在更高層給出研究方向,讓模型完成後續的大規模探索。”這形成了一條潛在的遞迴鏈條:AI執行實驗,實驗改進機器學習系統,改進後的系統再執行更復雜的實驗。Quoc Le甚至提出,這套方法可能幫助發現不同的Transformer架構。不過,從當前公開資訊來看,Discovery Loop所做的仍屬於受控的研發自迴圈,目標、實驗邊界、評價指標和最終判斷主要由人類設定,並非開放式RSI。

Jeff Dean在訪談中給出了一個比Token吞吐更適合衡量Discovery Loop的指標:“本質上,你要最佳化的是每單位計算輸入的發現數量。”過去,大模型公司用更多資料和算力訓練更強的模型;Discovery Loop希望建立另一條投入產出關係:把算力轉化為更多實驗,再把有效實驗沉澱成演算法、模型和科學成果。它未來出售的可能不只是一套科研Agent,還有被縮短的研發週期和被提高的發現機率。

這件事為什麼要離開谷歌做?Alphabet CEO Sundar Pichai曾在多次會面中挽留Jeff Dean等人;Oriol Vinyals對《連線》表示,大型組織總有很多慣性需要克服,“我們想做點不一樣的東西”。谷歌最終選擇投資Discovery Loop、提供首年算力,併合作研究機器學習系統和基礎設施。這更接近一次組織選擇:谷歌需要繼續推進Gemini、雲業務和大規模商業交付,Discovery Loop想把資源和精力集中到一件尚未形成成熟產品的事情上。Hassabis的職位變化從另一個方向回應了同一問題:他卸任Google DeepMind CEO,轉任董事長和Alphabet首席科學家,把日常運營交給Koray Kavukcuoglu,自己將更多精力投入AGI長期方向、科學應用和Isomorphic Labs的藥物研發。看起來,兩人都相信AI下一階段將深入人類的科學發現。

Alphabet股價在調整公佈後下跌約4%。市場擔憂的不只是一位科學家離開,還包括多位核心研究者同時出走、Gemini的競爭壓力,以及Hassabis退出日常運營後,谷歌能否繼續把龐大的研究、算力和產品資源組織到同一個方向上。更大的變化已經越過谷歌這家公司本身:Karpathy的AutoResearch、Google的AlphaEvolve、田淵棟等人創辦的Recursive,以及Jeff Dean的Discovery Loop,都在把AI放進下一代AI的研發過程。AI的下一步,可能不只來自更多引數、資料和算力,還來自模型參與提出實驗、驗證結果和設計後繼系統。但實驗數量無法替代人類對關鍵問題的選擇判斷。Jeff Dean在同一場訪談中說,未來真正稀缺的能力是“知道該讓Agent去解決什麼問題”。AI可以一天執行上千次實驗,但研究上限仍然取決於最初的問題和評價標準。Jeff Dean過去幫助谷歌把資料、計算和模型訓練變成可規模化的系統;現在,他和曾經對谷歌最重要的一批人,想把科學方法本身也變成一套可以規模執行的系統。Loop是他們選擇的方法,科學發現是它首先要進入的世界,遞迴自我改進可能是這條路線更遠的方向。