9月15日,智象(HiDream.ai)釋出原生全模態音影片生成模型HiDream-O1-Video-1.0(簡稱HiDream V1)。其圖生影片能力在Artificial Analysis排名第4,在Arena.ai的圖生影片模型榜單中排名第8,雙榜進入全球前十,躋身全球影片生成模型第一梯隊。

這一發布的時間點值得關注。近幾個月,AI影片生成賽道持續升溫:7月31日,Seedance2.5MiniMax H3同日釋出;8月,阿里釋出Wan3.0;進入9月,智象HiDream V1加入戰局。短短兩個月,多家廠商接連推出新一代影片生成模型,以位元組Seedance、MiniMax H3、阿里Wan 3.0和智象HiDream V1為代表的中國模型,開始在全球主流榜單頭部形成叢集,中國影片生成模型正從單點領先轉向多家並進。智象作為創業公司進入這一競爭區間,也意味著全球影片模型頭部牌桌上,除了大廠和上市企業,開始出現新的玩家。

從產品能力看,HiDream V1的一個差異化設計在於對使用者意圖的理解與時長規劃。常規影片生成工具要求使用者把提示詞寫得詳盡,鏡頭、光線、動作、時長逐項交代,但真實場景中使用者輸入往往只是一句口語或一個模糊念頭。HiDream V1的做法是,在生成前先通過多模態意圖理解模組分析需求,再呼叫多模態理解模型進行結構化規劃,規劃欄位覆蓋人物、動作、鏡頭、光影、台詞、聲音等關鍵資訊,將自然語言需求拆解成可執行的分鏡資訊後進入聯合生成。

時長也被納入規劃。多數模型的生成時長由提示詞預先設定,輸入5秒就在5秒視窗內完成內容,動作未結束也只能壓縮處理。HiDream V1則讓模型根據內容自行規劃時長,結合事件展開、動作完成和敘事節奏決定生成長度,原生支援5至20秒任意時長生成。在此基礎上,1080p高保真輸出保障單鏡頭畫質,為連續敘事提供基礎。

在實測中,智東西用三個場景檢驗了這套機制。意圖理解測試中,模型根據一張從故事中途切入的參考圖,還原了人與狗的動向,並在細節上透露出疲憊姿態。時長規劃測試中,面對一個撐不住十秒情節的短提示詞,HiDream V1並未強行湊時長,影片時長僅為7秒,鳥叫、貓咪抬頭動作與懶洋洋的姿態保持良好。音畫一致性測試中,模型在說唱舞台場景裡實現了嘴型與歌詞的對應,並將提示詞中故意漏掉的一個字補全。

更值得關注的是模型對真實世界運動規律的處理。影片模型要跨過的分水嶺,是讓畫面裡的運動符合真實世界的因果。HiDream V1在生成與敘事規劃中強化了對物理規律的建模,包括物體在重力下如何落下、碰撞如何反饋、慣性如何延續、光影如何衰減、空間如何保持連續等。

三組測試分別覆蓋精細操作、多人運動和複雜運動。擰螺絲場景中,模型理解了連續動作關係,螺絲刀與螺絲位置保持對應,雙手與工具的空間關係整體自然。NBA三分絕殺場景中,球員的肌肉線條、籃球的飛行軌跡和旋轉符合現實物理規律,僅在最後出現一點人物位置偏移。奧運會百米飛人大戰場景中,模型基本還原了從發令、起跑到並肩衝刺的完整過程,運動員跑步姿態、擺臂和腿部動作保持連貫,人物之間沒有明顯肢體穿模,腳步聲與步頻也能對應。

支撐這些能力的,是智象先規劃、後聯合生成、再以多模態Reward對齊的技術思路。在後訓練階段,智象採用Diffusion RL技術,並設計與人工認知對齊的多模態Reward模型。這套訓練鏈路背後是DMSampler、DiffusionCompass、EvoID三篇論文,分別收錄於2026年ICML、ECCV、CVPR三大頂會,從擴散強化學習取樣效率、生成質量控制和身份保持等方向提供技術支撐。

智象聯合創始人兼CTO姚霆表示,影片生成的代際進化不僅僅是畫素的提升和時長的延續,而在於模型是否真正理解創作者的意圖和真實世界的物理規律;HiDream V1從架構設計之初便面向文本、影片與音訊的統一表徵,原生全模態技術使之從看得清、動得順,邁向聽得懂、說得準、演得連貫。

HiDream V1的意義不只是新增一個影片模型。圍繞統一UiT(Unified Transformer底座,智象已形成影像、影片、3D、具身四個模型方向:影像解決視覺生成與理解,影片進入時間維度,3D對應互動式環境,具身深入真實動作與具身反饋。此前,HiDream-O1-Image商用版1.5在Artificial Analysis文生圖榜取得中國第一、全球第三;HiDream-O1-World在互動式世界模型基準WBench的Navi分榜以平均分80.9位列第一,物理一致性73.3分同樣第一;HiDream-O1-Embodied在RoboColiseum的Robustness子榜以平均分0.692登頂。這些模型共享UiT統一底座,文本、影像、影片、3D與具身資料能夠在同一個表徵空間裡處理。

智象聯合創始人兼CEO梅濤談及路線時表示,智象致力於構建一個原生全模態底座、四大模型同源演進的模型矩陣,所構建的不是四條彼此獨立的能力線,而是一套以統一技術架構為底座、面向世界模型持續進化、走向可落地的原生全模態體系。

從產業視角看,影片生成正從單一內容創作走向影視、廣告、電商等生產場景,行業競爭重點也在變化。除了畫質、時長和人物一致性等基礎要求,模型對複雜運動、物理規律等真實世界的理解正成為新的競爭維度。影片所記錄的是現實世界不斷變化的過程,當模型能進一步理解時間、空間、物理規律以及因果關係,影片生成所覆蓋的能力邊界也會隨之擴大,逐漸成為模型理解和模擬真實世界的一種路徑。HiDream V1的釋出,讓智象的原生全模態世界模型矩陣補上了影片這一塊重要拼圖,也讓其一個底座、四大模型同源演進的佈局真正顯現出來。