上海人工智慧實驗室(Shanghai AI Laboratory)的Intern Lumina U2團隊在Hugging Face上釋出了InternLumina-U2,一款將語言、影像、影片和3D統一進單一框架的多模態模型。該模型覆蓋文本問答、文生圖、影像理解、影像編輯、影片理解與3D理解六類任務,試圖用同一個模型處理過去通常由多個專用模型分別承擔的工作。

架構上,InternLumina-U2採用160億引數混合專家(MoE)設計,啟用引數為10億,即16B-A1B。它把高效的稀疏主幹網路與一套8碼本的全離散視覺表示配對,該表示基於AToken構建。所謂「多碼本擴散」,指的是用多個離散碼本承載視覺資訊、再以擴散方式生成,這與當前主流的連續潛空間擴散路線形成對照,也是該模型名稱中「Multi-Codebook Diffusion」的由來。

倉庫中託管的是同一架構、但在不同硬體棧上訓練出的檢查點。目前已提供的是昇騰(Ascend)版本,即在華為昇騰NPU上完成訓練;輝達GPU版本標註為「即將上線」。這一安排意味著同一模型架構在國產AI加速卡與輝達GPU兩條訓練路徑上並行推進,對關注國產算力實際訓練能力的觀察者而言,是一個可跟蹤的訊號。

使用方面,推理程式碼、環境配置與示例放在GitHub倉庫(InternLM/InternLumina-U2),執行infer_1024_sft.sh時需將CHECKPOINT指向上述子目錄之一。模型採用Apache 2.0許可,允許商用與二次開發,降低了開發者試用與整合的門檻。

效能方面,官方目前只給出「初步、部分」的基準測試結果,完整的對比表格將隨技術報告一併釋出,當前可參考GitHub倉庫中的表格。技術報告標註為「即將釋出」,專案主頁與程式碼連結也已一併提供。引用資訊顯示作者署名為Intern Lumina U2 Team, Shanghai AI Laboratory,年份標註為2026

從產業視角看,這條釋出有幾個值得留意的點。其一,多模態領域近來的競爭焦點正從「單點能力」轉向「統一架構」——用一個模型同時做理解與生成,可減少系統拼接帶來的工程複雜度,也便於在應用層做統一排程。其二,MoE加稀疏啟用的組合(16B總量、1B啟用)意在控制推理成本,這對希望把多模態能力部署到實際業務中的團隊更具吸引力。其三,全離散視覺表示路線若被驗證可行,可能為視覺token與語言token的進一步融合提供新的技術選項。

需要指出的是,目前公開的資訊仍屬早期:完整基準尚未披露,輝達版本尚未上線,技術報告也未釋出。模型的實際能力邊界、在不同任務上的表現差異,以及昇騰與輝達兩個版本之間是否存在效能差距,都還有待後續材料說明。對於關注多模態模型演進與國產算力訓練進展的讀者,這份釋出提供了一個可繼續觀察的樣本。