一家尚未公開名稱、也沒有正式產品的創業公司,已經拿到了近3000萬美元融資,投後估值2億美元。投資方包括五源資本和IDG,團隊規模約10人,計劃在2027年前後釋出完整模型。這個價格放在當下的世界模型賽道並不算離譜,但放在創始人田柯宇身上,故事就多了一層反差。

兩年前,田柯宇還是字節跳動的一名實習生。位元組稱他因嚴重違規被辭退;幾乎同一時間,他參與的論文拿下了NeurIPS 2024最佳論文。如今,他帶著同一份技術履歷進入世界模型創業。

這筆錢買的是什麼

五源資本今年組織的一次討論,把世界模型歸納為在動作條件下預測世界狀態變化。這個定義尚未成為行業共識,但它點出了資本為何開始關注這個方向:AI下一步要處理的,不只是文字和圖片,還包括空間、時間和動作。

田柯宇的公司選擇此時進入,吃的是一個明顯的時間視窗。世界模型還沒有穩定的產品形態,行業也沒有統一的評測標準。對投資人來說,這意味著風險很大,但也意味著技術路線、創始人和論文成績仍然可以先拿來定價。

田柯宇最有價值的資產,是一篇論文。2024年,他作為第一作者發表《Visual Autoregressive Modeling》,提出讓模型按照影像的不同尺度逐層生成,而不是像傳統模型一樣逐個畫素或逐個視覺Token處理。論文稱,這種方法能提高影像生成的速度和效率。這篇論文後來獲得NeurIPS最佳論文獎。面對相關爭議,NeurIPS回應稱論文采用盲審,評獎依據是科學質量。

此次創業方向基本延續了這條思路。據報道,田柯宇的團隊正在為AI建立一套新的視覺符號系統,包含約20萬個符號,用來處理影片資訊。他們計劃向系統輸入1億小時的影片,並希望把影片生成成本降低至少一個數量級。

這與五源資本今年5月組織的一場世界模型社群討論一脈相承。在一篇題為《2026年了,我們還在用愛迪生試燈絲的方式評估World Model》的文章中,其強調世界模型本質上是一場效率競爭:誰的壓縮比更高,誰就能佔據優勢位置。對技術效率的共同追求,可能是五源資本押注人的關鍵。畢竟目前,田柯宇的公司沒有公開模型,沒有產品,也沒有明確的商業模式。他的計劃是先把技術做出來,再在2027年左右釋出完整模型。

天才少年的以火攻火

2024年10月,關於字節跳動實習生攻擊模型訓練的訊息在社交媒體上成為AI圈的離經叛道傳奇。當時最誇張的版本是:事件涉及8000多張GPU,給位元組造成上千萬美元損失。

字節跳動隨後回應,稱確有實習生因嚴重違紀被辭退,但受影響的只是商業化技術團隊的某個研究專案,不涉及位元組的大模型,也沒有影響線上業務;8000多張卡和上千萬美元損失的說法嚴重誇大。第一財經後來報道稱,位元組內部通報認為,這名實習生在2024年6月至7月因不滿資源分配,通過編寫、篡改程式碼等方式干擾研究專案的模型訓練任務。位元組因此與他解除實習協議,並向法院提出800萬元損失、2萬元合理支出及公開道歉等訴求。之後位元組否認了網上流傳的損失金額和GPU數量。

最新報道中披露,田柯宇也給出了自己的說法。他承認自己關閉過另一名實習生的程式,目的是釋放計算資源給其他研究人員。他把這件事形容為用火攻火,並表示如果重新來一次,會採取更謹慎的做法。報道還稱,最終的結果是賠償50萬元,並沒收全部工資。

東方貝爾資本合夥人Vita Gu表示,國家政策對具身智慧給予了強力支援,市場上的資金也同樣積極。該機構參與了田柯宇公司的投資。她還表示,在眾多創業者中,田柯宇給她留下了特別深的印象,因為他能夠把一個複雜的想法講得很簡單。

全球世界模型競賽加速

田柯宇開始創業之際,全球範圍內的世界模型競爭正在加速。9月,AMD宣佈以約82億美元的全股票交易收購李飛飛創辦的World Labs。World Labs此前已完成10億美元融資,做的是能夠生成、重建和模擬三維空間的模型。Google DeepMind的Genie 3可以根據文字生成能夠即時探索的虛擬環境,執行速度達到每秒24幀,並在幾分鐘內維持場景的一致性。中國公司也開始把影片生成往即時互動上推,PixVerse今年釋出R1、R2,主打連續生成和可互動的視覺世界。

這些產品看起來仍然像影片工具,但行業想要的東西已經不只是畫面更逼真。影片模型負責生成下一幀畫面;更嚴格意義上的世界模型,還要理解動作和結果之間的關係:機器人向左移動之後會發生什麼,攝像機換一個角度後原來的物體是否仍然存在,某個物體受到外力後會如何運動。田柯宇的公司能否在2027年前後交出完整模型,將檢驗這筆2億美元估值買下的究竟是論文光環,還是可落地的技術效率。