愛詩科技在 2026 年 1 月提出「通用即時世界模型」這一產品方向並推出 R1,目前 PixVerse R2 已全量上線,使用者可直接進入網頁端體驗動作指令和互動影遊的相關互動。這條路線試圖回答一個更根本的問題:大語言模型已經用 Scaling 證明模型、資料和算力可以持續換來更強能力,必須一邊生成、一邊回應使用者的即時世界模型,能不能也走上同一條路?

過去幾年,Scaling 最具確定性的成功故事來自大語言模型。隨著模型容量、訓練資料和計算規模持續擴大,語言模型獲得了更強的理解、推理與泛化能力,「越大越強」由此成為大模型產業最重要的認知基礎之一。但把這條經驗遷移到世界模型,問題複雜得多。語言模型可以在接收問題後集中計算再給出答案,即時世界模型卻必須一邊執行,一邊接收使用者的動作、文字和聲音,同時繼續輸出連貫的音影片內容。這形成一組長期矛盾:即時要求模型足夠快、足夠高效,通用則要求模型足夠強、見過足夠豐富的世界。能力向上擴充套件,計算負擔隨之增加;為速度持續壓縮能力,即時體驗又容易停留在只能完成有限演示的專項模型。

PixVerse R2 給出的答案,是把能力與效率拆成兩層推進。按照官方定義,R2 的 Scaling 同時發生在模型容量、資料、任務、控制訊號和時間尺度五個維度上,最終轉化為使用者可感知的三類結果:更高的生成質量、更強的長程一致性,以及更豐富的多模態控制。

在產品端,R2 即時生成的世界「冬日宮殿」讓使用者面對一個仍在執行的環境。WASD 和方向鍵用於控制移動與視角,新指令可以繼續改變當前體驗;每次操作之後,頁面不會退回獨立的生成流程,使用者仍留在同一個世界裡。技術報告中的 Scaling 最終要回到產品端接受檢驗:它能否讓使用者真正進入一個世界,而不是在一段影片上疊加幾個控制按鈕?

對冬日宮殿會話的 HAR 網路記錄分析顯示,本輪會話中客戶端全程只觀察到一次 session_init 和一次 generation_started。此後八輪系統推薦 Prompt 共享同一條內容流,提示歷史從第一輪連續累積到第八輪,客戶端沒有為每一輪輸入重新預約資源、初始化會話或切換媒體通道。約 119.5 秒的生成窗口裡,所有操作都被組織在同一條持續 session 中。這意味著,從使用者可見的產品流程看,八輪 Prompt 並不是八個彼此獨立的影片任務拼湊起來的,而是當前世界下一步如何變化的連續控制輸入。一次生成不再以交付檔案為終點,還要成為後續行動不斷發生的環境。

同一會話中,HAR 還記錄到 3,355 條結構化 action_frame,傳送間隔中位數約 29.944 毫秒,折算頻率約 33.4Hz。使用者按住 W、組合方向或調整鏡頭時,客戶端持續傳送的是一條高頻、低層控制流,而不是把「向前走」轉寫成一句偶爾觸發的文字命令。傳統 AI 影片中的 Prompt 決定內容大致長成什麼樣,而在持續世界裡,Action 決定使用者此刻正在做什麼。當 Prompt 和 Action 能夠進入同一個執行過程,使用者與模型的關係才會從提出要求、等待結果,進一步變成進入環境、持續行動。

語言與動作也不需要輪流佔用這個世界。每輪 Prompt 從傳送到 prompt_generated 大約經歷 3.9 至 4.5 秒;在第三至第八輪中,Prompt 發出後約 8 至 26 毫秒,Action 就繼續進入控制通道,每個對應視窗內又持續傳送了約 129 至 152 條動作幀。也就是說,處理語義指令時,WASD 通道仍然保持開放,兩類輸入可以同時進入一條執行中的世界會話。延遲資料進一步說明這條即時鏈路怎樣工作:八輪推薦 Prompt 發出後,服務端 prompt_updated 的中位耗時約 1.33 秒,與愛詩所說的「約 1—2 秒響應」處在相同區間;完整 prompt_generated 事件的中位耗時約 4.27 秒。前者代表當前世界流中的指令狀態已經更新,並不等同於使用者恰好在 1.33 秒看見完整目標變化,但它說明從接收、稽核到世界流更新,R2 已經建立起一套秒級 Prompt 協議鏈路。

冬日宮殿也展示了 R2 當前對外開放的產品形態。初始化訊息顯示,它由一張首幀和 345 個字元的 world setting 啟動,同時配置了風格、音樂和 Action 等基礎資訊,並未設定 preset_video_uri。從客戶端可見流程看,頁面沒有播放一段預置底片,而是通過 pipeline=r2 返回持續生成的即時媒體。

如果說冬日宮殿展示的是「世界怎樣持續回應使用者」,那麼互動影遊 Zero Mark 展示的則是這套能力「如何進入一段更長、更有結構的內容產品」。兩者在介面上已呈現明確分工:World 直接提供 WASD、鏡頭和 Prompt,強調自由移動與即時變化;Story 則以結構化劇情選擇和電影化演出組織長敘事,同時保留文本入口,為固定分支之外的變化預留空間。HAR 進一步確認,兩者採用了不同的產品 pipeline:Winter Palace 執行在 r2 pipeline 中,Zero Mark 則使用 director pipeline。後者維持了一條約 20 分鐘的長 session:53 次有效狀態響應始終指向同一脫敏 session,狀態保持為 ACTIVE,媒體通道也沒有改變。同一長會話中還出現了多次媒體軌道分段切換,與 Director 的段落化編排形態相吻合;頁面記錄則確認了多次結構化劇情選擇,以及一次文本入口點選。本輪網路記錄中,同一會話裡同時出現了結構化選擇、即時媒體,以及八段預先準備的 1080p、24fps 關鍵電影資產。它們共同守住關鍵敘事節點的節奏與電影完成度,併為世界模型提供的開放變化留下入口。

技術解法上,PixVerse R2 把能力與效率拆到兩個層次分別推進:Omni Causal AR 負責持續抬高世界模型的能力上限,Real-Time Acceleration 再把上游能力帶回低延遲、可互動的執行區間。Omni Causal AR 是能力引擎,目標是把文字、參考圖、聲音和 Action 納入統一的因果世界模型。它用 Dynamic Chunk 適配不同控制訊號的時間粒度,通過分層的歷史與物件狀態機制維持長期錨點、近期動態和關鍵物件,再借助 Error Bank 等設計,讓模型學習如何從已經發生的偏差中繼續執行。Real-Time Acceleration 則是加速引擎:R2 不讓一個新的少步模型從頭學習整個世界,而是從同一個 Omni Causal AR 基礎初始化 Student 與蒸餾 Teacher,再通過同源蒸餾、稀疏計算和金字塔式少步生成,將上游已經獲得的生成、控制和長程能力盡可能完整地帶回即時區間。按照官方公開口徑,這套系統還試圖把世界模型壓縮到消費級單卡可以即時執行的範圍,使更強的基礎模型不必天然意味著更遠離使用者的離線演示。

愛詩走到 R2,首先源於對問題的不同定義。它沒有去持續追問怎樣再生成一段更長的影片,而是去思考怎樣讓生成內容成為一個使用者可以進入、可以行動、還願意繼續停留的世界。R1 先把生成影片轉變為持續互動過程,R2 再把擴大能力上限與壓入即時執行拆成兩個層次,這條演進路線從一開始就同時包含模型問題與產品問題。按照官方口徑,PixVerse 已擁有全球 1.5 億使用者,並從 2026 年 1 月起向普通使用者開放世界模型體驗。C 端即時服務會把延遲、併發和單位算力成本直接變成產品約束,因此 Real-Time Acceleration 不是基礎模型完成後的附加最佳化,而是整條路線本身的一部分。

從行業視角看,世界模型正在沿幾條不同路線快速抬高能力邊界。Google DeepMind 的 Genie 3 強調高解析度、數分鐘一致性與 Agent 訓練;Decart Oasis 3 把低延遲、多視角和 Physical AI 部署作為重點;World Labs Marble 選擇先生成可持久、可編輯和可匯出的顯式 3D 世界;HappyOyster、Odyssey 等路線,則分別向即時漫遊、導演模式和通用互動影片推進。它們分別代表能力、部署效率、顯式空間和產品形態的不同方向。如果用能力與通用性作為橫軸,用即時互動效率與產品可執行性作為縱軸,傳統方案往往需要在一條曲線上選擇位置:更強的模型可能執行得更慢,更快的模型又可能只覆蓋少量任務。R2 通過 Omni Causal AR 與 Real-Time Acceleration,讓能力和效率擁有可以分別推進的結構;它希望做到的,不只是在現有曲線上找到一個更好的靜態座標,而是讓整條曲線具備繼續向右上移動的可能。

當內容從檔案變成 session,生成式娛樂的產品單位也在發生變化。AI 影片與即時世界模型最根本的差別,或許不在於多了幾個控制鍵,而在於使用者進入的不再是一段等待播放的成品,而是一個持續執行、持續響應、可以不斷被改變的環境。這條路徑能否真正兌現「越大越強」的承諾,仍要看它在真實使用者規模下的延遲、成本與內容質量表現。