上海人工智能实验室(Shanghai AI Laboratory)的Intern Lumina U2团队在Hugging Face上发布了InternLumina-U2,一款将语言、图像、视频和3D统一进单一框架的多模态模型。该模型覆盖文本问答、文生图、图像理解、图像编辑、视频理解与3D理解六类任务,试图用同一个模型处理过去通常由多个专用模型分别承担的工作。

架构上,InternLumina-U2采用160亿参数混合专家(MoE)设计,激活参数为10亿,即16B-A1B。它把高效的稀疏主干网络与一套8码本的全离散视觉表示配对,该表示基于AToken构建。所谓「多码本扩散」,指的是用多个离散码本承载视觉信息、再以扩散方式生成,这与当前主流的连续潜空间扩散路线形成对照,也是该模型名称中「Multi-Codebook Diffusion」的由来。

仓库中托管的是同一架构、但在不同硬件栈上训练出的检查点。目前已提供的是昇腾(Ascend)版本,即在华为昇腾NPU上完成训练;英伟达GPU版本标注为「即将上线」。这一安排意味着同一模型架构在国产AI加速卡与英伟达GPU两条训练路径上并行推进,对关注国产算力实际训练能力的观察者而言,是一个可跟踪的信号。

使用方面,推理代码、环境配置与示例放在GitHub仓库(InternLM/InternLumina-U2),运行infer_1024_sft.sh时需将CHECKPOINT指向上述子目录之一。模型采用Apache 2.0许可,允许商用与二次开发,降低了开发者试用与集成的门槛。

性能方面,官方目前只给出「初步、部分」的基准测试结果,完整的对比表格将随技术报告一并发布,当前可参考GitHub仓库中的表格。技术报告标注为「即将发布」,项目主页与代码链接也已一并提供。引用信息显示作者署名为Intern Lumina U2 Team, Shanghai AI Laboratory,年份标注为2026

从产业视角看,这条发布有几个值得留意的点。其一,多模态领域近来的竞争焦点正从「单点能力」转向「统一架构」——用一个模型同时做理解与生成,可减少系统拼接带来的工程复杂度,也便于在应用层做统一调度。其二,MoE加稀疏激活的组合(16B总量、1B激活)意在控制推理成本,这对希望把多模态能力部署到实际业务中的团队更具吸引力。其三,全离散视觉表示路线若被验证可行,可能为视觉token与语言token的进一步融合提供新的技术选项。

需要指出的是,目前公开的信息仍属早期:完整基准尚未披露,英伟达版本尚未上线,技术报告也未发布。模型的实际能力边界、在不同任务上的表现差异,以及昇腾与英伟达两个版本之间是否存在性能差距,都还有待后续材料说明。对于关注多模态模型演进与国产算力训练进展的读者,这份发布提供了一个可继续观察的样本。