在AI行業Coding賽道陷入價格戰與估值回撥的當下,視覺多模態領域卻迎來資本密集押注。智象未來(HiDream.ai)近日宣佈完成15億元C輪融資,由社保基金四川振興科創基金、工銀資本、弘頤資管、敦鴻資本聯合領投,廈門國貿資本、上影新視野基金、湖北長江產業投資集團、華策影視等跟投,老股東合肥產投、東方富海、金浦投資等持續加註。這已是該公司近三個月內完成的第三輪融資,累計融資額超過21億元,估值躋身全球AI獨角獸行列。
此次融資的資本結構呈現罕見的複合特徵:國家隊耐心資本(社保基金)、金融國家隊(工銀資本)、影視產業國家隊(華策影視、上影新視野)、頭部產業資本與市場化VC同時入局。這種多元資本組合在AI多模態模型賽道中並不多見,反映出投資方對視覺生成作為下一代世界模型入口戰略價值的共識。
與Coding賽道不同,視覺多模態領域的競爭已從單一模型引數競賽升級為綜合能力比拼。資料壁壘更高——高質量影像、影片、影視素材涉及版權與IP規範;工程壁壘更復雜——需處理空間、時間、運動、光影、物理規律及多主體互動;評價體系更多維——審美、鏡頭語言、風格一致性、可控性缺一不可;工作流繫結更深——一旦嵌入影視製作、廣告營銷、電商內容生產流程,遷移成本極高。這些特性使得頭部廠商更容易構建護城河。
智象未來在今年WAIC上釋出的vivago R1,是全球首個無限時長內容創作智慧體。其底層採用多Agent協作架構:排程層像總導演只記錄角色設定與敘事主線;中間層是編劇、導演、設計師等專家Agent,各自擁有獨立記憶;執行層負責分段併發生成,某一段失敗只重試該段,不影響整體。這一架構與Claude Code的多Agent協作思路類似,但解決的是長鏈路影片創作而非程式碼開發。
實測顯示,vivago R1能將“創作一段1分鐘連續敘事生活短片”的指令自動拆解為多場景、多鏡頭敘事,並保持角色一致性、電影級畫面質感與連貫動作。其內容有效可用成功率提升至85%,達到商業規模化交付門檻。目前,vivago海外版已覆蓋5000萬用戶、100多個國家和地區,今年5月灰度版登頂Product Hunt日榜第一,擁有百萬級付費使用者。
智象未來的技術路線指向世界模型——讓AI不僅能生成內容,還能理解物理規律、推演因果關係、預測動作後果。創始人梅濤認為,真正的世界模型必須同時具備表達世界、推演世界、構造世界三種能力。公司自研的UiT架構(Unified Transformer)摒棄傳統VAE影像壓縮和獨立文本編碼器,將影像畫素、文本Token、影片體素、音訊、動作、空間關係等原始訊號對映進同一共享Token空間,實現原生全模態統一建模。這一方向與谷歌2026年初發布的Gemini Embedding 2、輝達的Nemotron 3 Nano Omni等全球科技巨頭的佈局不謀而合。
視覺多模態賽道的崛起,正在改寫AI產業的資本敘事。當Coding賽道因同質化競爭與Token價格戰陷入估值回撥時,視覺生成憑藉更高的資料壁壘、更深的工作流繫結和更復雜的評價體系,展現出更強的商業確定性與成長性。智象未來的融資案例表明,資本正從“模型引數競賽”轉向押注“世界模型”這一更長期的AGI路徑。