上海人工智慧實驗室的InternLM團隊在Hugging Face上線了InternLumina-U2,官方將其定位為「多碼本擴散大語言模型」,目標是用一個模型同時完成全視覺理解、影像生成與編輯。該倉庫標註許可證為Apache 2.0,模型卡顯示更新於約12分鐘前,技術報告標註為「即將釋出」。
從模型卡披露的資訊看,InternLumina-U2是一個統一多模態框架,把語言、影像、影片和3D納入同一體系,覆蓋的任務包括文本問答、文生圖、影像理解、影像編輯、影片理解和3D理解。架構上,它是16B引數的混合專家模型(MoE),但每次推理僅啟用1B引數,即官方所稱的16B-A1B配置——用高效稀疏主幹搭配視覺側的重型表示,以控制單次推理的算力開銷。
視覺表示是這一模型的核心設計之一。模型卡稱其採用基於AToken構建的8碼本全離散視覺表示,並配合擴散式生成路徑。這種「多碼本+全離散」的組合,通常意在把連續視覺訊號壓縮成可被語言模型直接處理的離散token,從而讓理解與生成共享同一套表徵,而不必為生成任務單獨掛一個連續空間的解碼器。
倉庫結構上,同一架構提供了按硬體棧區分的檢查點:ascend/目錄對應在華為昇騰NPU上訓練的版本,nvidia/目錄對應在輝達GPU上訓練的版本,後者標註為「即將上線」。這意味著同一模型架構被分別跑通在兩套算力生態上,對國內開發者而言,昇騰版本的可獲取性是一個值得注意的訊號。
使用方式上,推理程式碼、環境配置與示例放在GitHub倉庫(InternLM/InternLumina-U2),執行`infer_1024_sft.sh`時需要把`CHECKPOINT`指向上述子目錄之一。基準測試方面,模型卡明確說明當前只有「初步、部分結果」,完整對比表將在即將釋出的技術報告中給出,現階段可參考GitHub倉庫中的表格。引用資訊顯示作者署名為Intern Lumina U2 Team, Shanghai AI Laboratory,年份標註為2026。
從產業視角看,這條釋出延續了近一年來多模態領域的一條主線:把「理解」與「生成」從兩個割裂的模型棧合併進同一個稀疏主幹,並用離散視覺token作為橋樑。若這一路線在後續技術報告中得到完整基準驗證,其意義在於訓練與推理成本的攤薄——一套權重同時服務問答、編輯與生成,對下游應用方意味著更低的部署複雜度和更少的模型維護成本。
另一條值得關注的線索是硬體適配。模型卡同時列出昇騰與輝達兩套檢查點,說明訓練側已不侷限於單一GPU生態;對關注國產算力落地進展的觀察者來說,這類「同架構、雙棧訓練」的公開權重,是衡量國產NPU在大規模多模態訓練中可用性的一個具體樣本。不過,由於完整基準尚未公佈,目前還無法判斷該模型在各項任務上相對同類統一多模態模型的實際位置,模型卡本身也提示結果僅為初步。