2024 年圖靈獎得主、被譽為現代強化學習聯合創始人的 Richard Sutton 正式踏入創業賽道。他在加拿大多倫多創立了一家名為 Oak Lab 的新公司,聯合創始人為 Khurram Javed。兩人此前均曾在傳奇遊戲程式設計師 John Carmack 創辦的 AI 公司 Keen Technologies 共事,如今帶著對強化學習的共同信念獨立啟航。

Sutton 對當前主流深度學習路線提出了尖銳批評。他直言現有方法“薄弱且低效”,並強調“需要的不是更多修修補補,而是根本性的新思路和徹底的重構,才能為實現 AI 更宏大的目標提供堅實基礎”。這番表態並非一時興起——今年 6 月他就曾公開指出,生成式 AI 擅長模仿,卻無法評估自身輸出,因而不具備真正的發現能力

Oak Lab 的核心理念正是圍繞這一判斷展開。與 Keen Technologies 一脈相承,新公司將賭注押在強化學習上,堅信 AI 應該在執行中從經驗裡持續學習,而非僅在靜態資料集上完成一次性訓練。Sutton 構想的智慧體需要具備三項關鍵能力:從環境中持續學習自主構建內部世界模型,以及獨立完成變異、評估與選擇的完整閉環。

在技術願景上,Oak Lab 設定了一個極為激進的長期目標——打造一個擁有“萬億引數”、能在 20 瓦功耗下即時學習與規劃的智慧體。這一指標暗合人腦的能效水平,也透露出團隊試圖在演算法效率而非單純算力堆砌上尋求突破的野心。

從產業格局看,Sutton 的入場時機頗為微妙。當前 AI 產業主流敘事仍被大規模預訓練模型和 Scaling Law 主導,OpenAI、Google DeepMind 等機構沿著“更大模型、更多資料”的路徑高歌猛進。而 Sutton 代表的強化學習路線則強調線上學習、持續適應和自主探索,這在理論上更接近通用智慧的本質要求,但在工程落地和商業驗證上仍面臨巨大挑戰。

值得注意的是,Oak Lab 的創始團隊背景兼具學術深度與產業經驗。Sutton 本人是強化學習領域的奠基人之一,其著作《強化學習導論》幾乎是該領域所有研究者的必讀書目;Khurram Javed 則在 Keen Technologies 積累了將強化學習理論工程化的實戰經驗。兩人選擇在此時獨立創業,或許意味著他們看到了現有技術路線逼近瓶頸後,範式轉換的視窗期正在開啟

對 AI 產業投資者而言,Oak Lab 的出現提供了一個觀察“非主流路線”商業化潛力的樣本。如果 Sutton 團隊能在自主學習智慧體上取得實質性突破,可能撬動從機器人、自動駕駛到科學發現等一系列需要持續適應能力的應用場景,而這些恰恰是當前靜態模型難以勝任的領域。當然,從實驗室原型到萬億引數即時學習系統的工程跨越,其難度和不確定性同樣不容低估。