愛詩科技(AIsphere)最新發布的即時世界模型 PixVerse R2 在海外引發關注:9 月 22 日上線當天,它登上 X(Twitter)趨勢榜第二。與常見的影片生成產品不同,使用者進入 PixVerse R2 創造的世界後可以移動、說話、做出選擇,輸入的每一個提示詞和每一個動作都會即時改變眼前場景,甚至讓劇情走向不同方向。有海外網友認為,這標誌著 AI 生成從「創作影片」轉向「與 AI 世界互動」,也有人形容體驗不像看影片,更像身臨其境。
要理解 R2 的意義,需要回看愛詩科技過去一年的產品線。今年 1 月,該公司釋出 PixVerse R1 通用即時世界模型,首次讓使用者進入 AI 即時生成的世界:與傳統影片生成一次性輸出固定內容不同,使用者可以在生成過程中持續輸入指令、改變行動,模型隨之更新場景。R1 證明即時、連續、可互動的音影片生成可以成立;R2 則進一步處理這個即時生成的世界,讓使用者在其中移動、探索,並通過不同行為改變環境與後續發展。此後半年,愛詩科技沿即時、互動、世界演化這條線擴充套件,陸續加入個性化 Avatar、Shared Worlds 與多人共同輸入,並通過 PixVerse Game Engine 把即時世界模型與 Agent、遊戲機制連線起來。8 月 23 日,公司釋出 PixVerse R2 技術報告,披露其技術路線。
從實機體驗看,R2 的互動大致分為三層。最基礎的是 WASD 控制角色,體現即時響應:在草原越野場景中,使用者可以開車加速、轉向、爬坡,還能隨時給世界「加東西」,比如召喚雄鷹、指定彩虹位置,甚至把車點燃,操作與世界變化基本連續發生,無需退出場景重新生成。第二層是自然語言改變世界,體現指令理解與動態生成:在逃離戰區場景中,人物可自由移動,輸入指令後能做出慶祝動作、召喚閃電;在《草原奧德賽》中,輸入提示詞后角色可以長出翅膀飛起,也能開啟降落傘。第三層是進入互動影遊,考驗 AI 能否把互動、劇情、音效與世界狀態串在一起:在《零印法師》中,使用者面對前期 Boss 時直接輸入「變小狗」,主角隨即釋放魔法把 Boss 變成金毛。玩家不再只能從開發者預設的技能和選項中挑選,而是可以用自然語言向世界提出要求。
這些體驗背後,是即時世界模型必須解決的一組難題。當用戶持續介入一個 AI 生成的世界,模型要做的就不只是生成速度,還要看懂使用者在做什麼、記住已經發生的事情、維持畫面與空間關係的一致性,並及時響應下一步動作。對應到技術報告,PixVerse R2 提出四個核心能力:長程一致性、多模態控制、因果響應和狀態保持。這些要求彼此並不獨立——模型理解越深、需要保持的狀態越多、生成時間跨度越長,背後的資訊與計算量就越大,而即時互動又要求模型在下一秒給出結果,沒有時間慢慢「算完」。由此引出一個關鍵問題:即時世界模型能否像大模型一樣,找到一條持續 Scaling 的路徑?
PixVerse R2 給出的思路,是把「模型能力」與「即時執行」拆開解決,再重新放進同一套訓練和推理路徑。一方面,Omni Causal AR 將文字、參考影像、音訊、動作等不同訊號統一納入世界建模,讓模型理解空間、時間與使用者行為之間的關係;其中「Causal AR」讓模型沿時間持續推進世界,當前狀態成為下一步生成的依據。另一方面,Real-Time Acceleration 框架把推理加速等環節接入即時執行過程。一個值得注意的設計是,同一套 Omni Causal AR 既作為蒸餾 Teacher,也作為學生模型的初始化基礎,讓即時模型沿原有世界建模能力繼續演化,而不是從頭訓練一個只追求速度的模型。兩者銜接,形成「持續擴大能力上限,再穩定加速到即時執行」的演進路徑。
更值得注意的是,R2 並未把 Scaling 簡單理解為擴大規模,而是拆分為模型、資料、任務、控制訊號、時間尺度五個維度:模型規模決定能力上限,資料和任務決定可覆蓋的世界範圍,控制訊號決定使用者介入世界的方式數量,時間尺度決定模型能否在更長時間裡保持狀態並持續演化。這條路徑不只對應 R2 的一次升級,也是愛詩科技對即時世界模型如何持續擴充套件的技術回答。
從產業視角看,生成式 AI 過去解決的多是「給我一個結果」——輸入提示詞,得到一篇文章、一段程式碼、一張圖片或一條影片,交付完成即結束。當模型能夠理解使用者行為、並依據已發生的狀態繼續生成,AI 交付的就不再是一段固定內容,而是一個可以被進入、被操控、不斷變化的世界。除遊戲之外,互動影視、虛擬角色、教育培訓、工業模擬等場景同樣存在大量需要根據使用者行為即時變化的內容;過去這些變化需要提前設計和製作,未來其中一部分可能在使用者真正進入之後才發生。PixVerse R2 所探索的,正是從「生成內容」到「生成世界」的這一演變過程,而它能否在保持即時性的同時持續提升能力,將決定這類產品能走多遠。