7月18日,在2026世界人工智慧大會(WAIC)現場,智象未來正式釋出全球首個無限時長內容創作多模態智慧體vivago R1,並宣佈已完成C輪融資,近三個月累計融資超20億元人民幣。這一發布標誌著AI影片生成從單點素材生成向長鏈路創作編排的轉變,而實測顯示,其核心競爭力在於模型聚合之上的Agent編排能力。
vivago R1的母公司智象未來(HiDream.ai)成立於2023年3月,總部位於北京,創始人兼CEO梅濤曾任職微軟亞洲研究院高階研究員、京東高階副總裁,並於2025年當選ACM Fellow。公司定位為“全球唯一同時支援文本、影像、影片、3D四個模態的基礎模型廠商”,此前開源過文生圖模型HiDream-I1。vivago R1是智象面向專業創作者的智慧體平台,其前身Vivago Video Agent於2026年5月在Product Hunt上線,曾獲當日產品榜第一,但當時單條影片輸出時長封頂3分鐘。兩個月後,R1將目標提升至無限時長。
R1的核心優勢被概括為“長、長、穩”:無限時長、長任務思考、高穩定生成。官方稱,其內容有效可用成功率提升至85%左右,遠高於行業平均水平。技術架構上,R1是一個技能驅動的編排Agent,擁有17個功能技能,覆蓋影片、影像、電商、社媒等垂類,其中cinematic-story-director是最成熟的旗艦技能。底層影片生成採用“自研模型+聚合第三方模型”的混合模式,根據其官網llms.txt檔案,聚合了Sora 2、可靈v2.6 Pro、Veo 3/3.1以及自研Vivago 2.0(現已更名HiDream 2.0)。前端使用者只能看到能力選項(如“拍個電影故事”),無法感知具體模型,模型路由完全在服務端完成。
實測中,作者設計了一部“葉什爾查姆風格”的土耳其山寨科幻爛片,以考驗R1在荒誕、多鏡頭、跨場景長敘事下的一致性。成片時長1分11秒,敘事、鏡頭切換流暢,人物、道具、風格從頭到尾幾乎不崩,廉價美學得以保留。Agent日誌顯示,其運行了cinematic-story-director技能,流程為:理解任務→故事初稿→視聽劇本→拆分場景→美術指導→生成鎖定參考圖→文字分鏡→影片提示詞→逐場景生成→拼接成片。一致性主要來自“鎖定參考圖+逐段參考圖生影片”的工程編排,而非模型長程記憶。唯一瑕疵是41秒處有數秒畫面發黏,以及背景輕微漂移,但整體完成度極高。
長影片編排正成為行業共識。2026年6月,伯克利哈斯商學院專欄文章指出,模型和編排框架正在商品化,純軟體Agent的護城河最弱,護城河正從模型遷移至物理體驗。資本市場上,Cursor於2026年6月被SpaceX以600億美元收購,Manus曾接近以20億美元被收購,OpenRouter也在洽談收購。這些案例表明,聚合是手段,編排出的體驗才是產品核心。對於AI影片產品,真正的價值在於Agent編排層能否做出別人做不出的、可驗證的東西。
當前主流AI影片產品時長多在秒級至兩分鐘:谷歌Veo 3.1單段約8秒,OpenAI Sora 2約60秒(消費端已於2026年4月關停),快手可靈3.0號稱“導演級”可達兩分鐘。若R1能穩定產出五分鐘以上且連貫的成片,將填補市場空白。技術上,長片生成的主流做法是編排現有SOTA模型並跨鏡頭縫合,因為單段模型受物理限制,一次穩定生成時長有限。R1選擇編排層方向已被行業證實,但方向對不等於做得好,實測驗證了其可行性。
R1的釋出和融資進展,反映了AI影片賽道從模型競賽轉向編排能力競爭的趨勢。對於投資者而言,關注點應從底層模型引數轉向產品能否通過編排解決長影片一致性痛點,這或許是新的護城河所在。