商湯大裝置與多模態生成式AI企業智象未來(HiDream.ai)近期宣佈,雙方已跑通影片生成業務從國外GPU到國產算力的完整遷移鏈路,實現業務無感切換。這一合作不僅解決了國產算力在真實生產環境中的適配難題,也為AI企業大規模採用國產晶片提供了可複用的工程樣板。
對於以影像、影片生成模型為核心業務的AI企業而言,國產化遷移並非簡單更換GPU。影片生成模型引數規模大、推理鏈路長、計算密集度高,從底層算力、推理框架到模型效能、生成效果和工具鏈,每一環都可能成為卡點。智象未來作為全球領先的多模態生成式AI企業,其自研HiDream系列大模型已覆蓋商業營銷、影視創作、內容創作等場景,產品服務全球100多個國家和地區的超過5000萬名專業使用者及4萬餘家企業客戶。此次與商湯大裝置的合作,正是圍繞其重點業務展開的國產算力適配驗證。
商湯大裝置從底層算力替代出發,深入模型推理、效能最佳化、生成效果等關鍵環節,通過全棧技術適配與FDE(Forward Deployed Engineer)專家服務,幫助智象未來在國產算力環境下平穩執行。針對視覺生成應用對效能的高要求,雙方設定了明確業務指標:在國產算力環境下實現高畫質影片高效生成,並將端到端生成時長最佳化至業內領先水平。
為實現這一目標,商湯大裝置團隊基於LightX2V進行了多卡並行最佳化,並探索多機多卡擴充套件能力。通過訓練-推理聯合最佳化思路,採用步數蒸餾、CFG蒸餾等訓練方案,在保持影片質量的同時顯著提升推理速度。推理過程中引入CFG雙分支並行、Ulysses序列並行、TP並行等多層次並行策略,對計算任務進行拆解與協同排程,最終在國產晶片執行DiT模型的場景下,多卡並行影片生成加速比達到93%,充分釋放了國產算力效能。
然而,效能提升只是第一步。如果模型遷移後生成的人物表情、動作、細節出現明顯變化,國產化遷移仍難以真正進入生產環境。雙方團隊發現,同一模型在單卡和多卡環境下可能存在細微的生成效果差異,例如人物表情特徵表現不同。為此,商湯大裝置最佳化多卡通訊過程,通過重新注入Face特徵等方式,加強多卡推理過程中的特徵一致性,使多卡生成效果向單卡對齊。此外,針對部分影片尾幀手指等細節不清晰的問題,團隊排查發現與模型訓練和推理階段影片幀數差異有關,通過補齊和最佳化推理過程,改善了長影片生成的細節表現。
除了單一晶片適配,智象未來還需應對不同國產晶片之間的異構適配挑戰。商湯大裝置構建了統一的硬體抽象體系,通過異構硬體初始化、統一裝置抽象層、Registry排程工廠、硬體運算元外掛等,遮蔽了不同底層硬體的差異,實現“一次開發,多平台適配”,目前已支援10餘種異構晶片上的模型零成本遷移。同時,商湯大裝置完成了ComfyUI等主流AI開發工具生態適配,使用者無需改變原有工作流和開發習慣,即可在國產算力平台完成應用開發與部署,大幅降低遷移和開發成本。
對於AI科創企業而言,模型研發和產品迭代本身已需大量資源,若再投入人力完成國產化適配,將增加額外成本。商湯大裝置通過FDE專家服務模式,將專業工程能力深入智象未來業務場景,組織團隊參與從模型遷移、運算元最佳化、多卡並行到生成效果調優、工具鏈適配的全過程,圍繞實際業務指標逐項排查和解決問題。這種“算力平台+工程專家”的協同方式,幫助AI企業減少國產化遷移的工程投入,將更多研發資源聚焦於模型創新與產品迭代。
目前,智象未來影像模型已完成國產算力適配驗證,並支撐規模化線上流量及短影片創作。此次合作驗證了國產算力支撐影片生成業務的可複用路徑:以底層異構算力為基礎,以統一硬體抽象體系和開發工具適配為連線,以模型效能與生成效果最佳化為核心,通過FDE專家服務深入業務現場,實現從全棧適配、技術驗證到規模生產的完整閉環。未來,雙方還將圍繞更多AI應用場景深化合作,推動國產算力從“能用”加速邁向“好用”。