9月1日,上海3D生成大模型公司影眸科技正式釋出世界生成模型Hyper3D WorldGen,標誌著3D生成從“單個資產”邁向“完整場景”的新階段。使用者只需上傳一張場景圖片,模型即可自動識別畫面中的主要物體並生成對應的3D資產,也支援手動框選目標生成,最終通過自研的CAST架構重建物體之間的空間與物理關係,輸出由多個獨立、可編輯、可替換、可互動資產組成的3D場景。

CAST(基於單張RGB影像的元件對齊式3D場景重建)是影眸Hyper3D團隊在2025年釋出的場景級生成研究成果,其核心能力包括從單張圖片中補全被遮擋物體的三維結構、判斷物體間的接觸、支撐、懸掛等關係,並將多個獨立物體放置於統一且物理合理的三維空間中。該研究曾榮獲SIGGRAPH 2025最佳論文,為WorldGen提供了堅實的技術底座。

在媒體交流會上,影眸科技聯合創始人、CTO張啟煊現場演示了WorldGen的生成流程:上傳一張辦公室盥洗室的圖片後,系統自動識別出水龍頭、盤子、水果等主要物體,約2-3秒生成單個物體的3D預覽,並在2-3分鐘內還原出完整場景。這些物體均為可獨立選擇、移動和替換的資產。開啟SimReady功能後,系統還能為資產估計質量、大小和摩擦係數等物理屬性,例如水果可在力的作用下滾入水池。使用者還可根據物體重要程度選擇不同生成精度,先快速搭建場景結構,再對重點資產精修。

影眸科技創始人、CEO吳迪舉例說明,傳統生成模型將會議室圖片轉化為3D場景時,桌椅、牆壁等物體往往被合併在一起,難以單獨編輯;而WorldGen能夠拆分主要物體、生成獨立資產,並還原其空間與物理關係。為兼顧場景可用性與視覺完整性,WorldGen採用混合表達:需要編輯互動的物體使用具備完整幾何結構的網格模型(Mesh),便於後續調整和新增物理屬性;背景則採用側重外觀還原的3D高斯潑濺(3D Gaussian Splatting),保留更多環境細節。

WorldGen並非針對單一行業開發,其應用場景覆蓋具身智慧、遊戲、影視製作和XR四大領域,目前已在不同方向推進落地。在具身智慧領域,影眸Hyper3D已與地瓜機器人謀先飛合作推出模擬訓練方案:WorldGen負責生成可模擬3D場景,謀先飛進行模擬適配,地瓜機器人提供算力與開發工具鏈。張啟煊表示,生成式3D能快速擴充物體種類和場景佈局,但不會完全替代真實資料,機器人訓練未來更可能混合使用模擬與真實資料。

在影視領域,WorldGen可解決影片模型在多鏡頭中難以保持空間和物體位置一致的問題。創作者可先生成空間結構明確的3D場景,調整鏡頭、移動物體和修改佈局,再交由Seedance 2.5等影片模型補充人物表現、材質、光影和畫面風格。在遊戲和專業3D製作領域,WorldGen生成的獨立網格資產可進入Blender、Unity、PlayCanvas、Unreal Engine等數字內容創作工具及即時引擎,繼續材質調整、動畫繫結、關卡編輯和效能最佳化。今年7月,影眸Hyper3D已與Unity中國宣佈合作,嘗試打通從3D生成到即時遊戲應用的流程。在XR領域,WorldGen可將參考圖片還原為可編輯三維空間,用於室內設計、空間展示和沉浸式體驗。張啟煊透露,上述應用目前主要處於內測或技術驗證階段,團隊將根據客戶需求確定後續投入重點。

針對技術邊界,張啟煊表示,系統生成的質量、摩擦係數等物理屬性並非對真實物體的精確測量,而是結合資產體積、視覺資訊、周圍物體關係、傳統估計算法及視覺語言模型進行推斷,因此不能作為精密工程資料使用。現階段WorldGen主要支援剛體生成,尚未覆蓋關節化資產、柔體和流體。關於與“世界模型”的關係,吳迪指出,世界模型既包括面向決策和行動的行動模型,也包括生成可互動、可訓練環境的模型,WorldGen更接近後者;影眸Hyper3D的核心定位仍是3D生成,不會因此定義為世界模型公司。他認為,影片模型擅長最終畫面呈現,3D則能明確儲存物體、空間結構和物理關係,兩條路線並非相互取代,未來更可能以混合方式結合。

從單個資產走向完整場景,WorldGen讓生成結果具備更強的可控性、可編輯性和工作流相容能力。隨著3D生成從“看起來好看”走向“真正可用”,場景級生成正在成為連線遊戲、影視、具身智慧和XR等行業的新基礎能力。3D生成的競爭重點正從單個模型的視覺質量,轉向場景的可控性、物理合理性和工作流相容能力。儘管WorldGen仍以剛體生成為主,部分物理屬性依賴推斷,在多個行業尚處驗證與早期落地階段,但從“生成資產”走向“構建場景”已成為3D生成領域可行性較高的方向。