上海人工智能实验室的InternLM团队在Hugging Face上线了InternLumina-U2,官方将其定位为「多码本扩散大语言模型」,目标是用一个模型同时完成全视觉理解、图像生成与编辑。该仓库标注许可证为Apache 2.0,模型卡显示更新于约12分钟前,技术报告标注为「即将发布」。
从模型卡披露的信息看,InternLumina-U2是一个统一多模态框架,把语言、图像、视频和3D纳入同一体系,覆盖的任务包括文本问答、文生图、图像理解、图像编辑、视频理解和3D理解。架构上,它是16B参数的混合专家模型(MoE),但每次推理仅激活1B参数,即官方所称的16B-A1B配置——用高效稀疏主干搭配视觉侧的重型表示,以控制单次推理的算力开销。
视觉表示是这一模型的核心设计之一。模型卡称其采用基于AToken构建的8码本全离散视觉表示,并配合扩散式生成路径。这种「多码本+全离散」的组合,通常意在把连续视觉信号压缩成可被语言模型直接处理的离散token,从而让理解与生成共享同一套表征,而不必为生成任务单独挂一个连续空间的解码器。
仓库结构上,同一架构提供了按硬件栈区分的检查点:ascend/目录对应在华为昇腾NPU上训练的版本,nvidia/目录对应在英伟达GPU上训练的版本,后者标注为「即将上线」。这意味着同一模型架构被分别跑通在两套算力生态上,对国内开发者而言,昇腾版本的可获取性是一个值得注意的信号。
使用方式上,推理代码、环境配置与示例放在GitHub仓库(InternLM/InternLumina-U2),运行`infer_1024_sft.sh`时需要把`CHECKPOINT`指向上述子目录之一。基准测试方面,模型卡明确说明当前只有「初步、部分结果」,完整对比表将在即将发布的技术报告中给出,现阶段可参考GitHub仓库中的表格。引用信息显示作者署名为Intern Lumina U2 Team, Shanghai AI Laboratory,年份标注为2026。
从产业视角看,这条发布延续了近一年来多模态领域的一条主线:把「理解」与「生成」从两个割裂的模型栈合并进同一个稀疏主干,并用离散视觉token作为桥梁。若这一路线在后续技术报告中得到完整基准验证,其意义在于训练与推理成本的摊薄——一套权重同时服务问答、编辑与生成,对下游应用方意味着更低的部署复杂度和更少的模型维护成本。
另一条值得关注的线索是硬件适配。模型卡同时列出昇腾与英伟达两套检查点,说明训练侧已不局限于单一GPU生态;对关注国产算力落地进展的观察者来说,这类「同架构、双栈训练」的公开权重,是衡量国产NPU在大规模多模态训练中可用性的一个具体样本。不过,由于完整基准尚未公布,目前还无法判断该模型在各项任务上相对同类统一多模态模型的实际位置,模型卡本身也提示结果仅为初步。