书生团队(InternLM)今日在Hugging Face发布新模型Intern-S2-Mobius,这是一个35B参数的基础模型,基于Mobius-v0架构构建,由XtunerLMDeploy实现。该模型的核心创新在于将知识存储与推理计算解耦,通过全局共享的记忆库和多个推理器的迭代查询,实现了更高效的推理。据技术报告,其端到端推理速度相比传统Transformer基线提升近4倍,同时在下游任务上保持甚至超越原有性能。

Intern-S2-Mobius从Qwen3.5-35B持续预训练而来,并经过监督微调(SFT)和强化学习(RL)后训练。其架构设计摒弃了传统Transformer中逐层绑定知识存储与推理计算的方式,而是将知识组织为全局共享的Memory,让多个Reasoner迭代查询并精炼隐藏状态。这种分离带来了两个原生能力:Backward Residual Connection(后向残差连接),使推理阶段能访问超越局部层层级的知识;以及Dynamic Latent Reasoning(动态潜在推理),将思考、精炼和多token预测内化为高密度连续状态。

在性能评测中,Intern-S2-Mobius在通用推理基准上相比Qwen3.5-35B基线取得了更高的平均分,并在科学任务如Biology-InstructionsMol-InstructionsMolecularIQ上显示出大幅提升。模型在推理时生成的推理轨迹更短,请求吞吐量更高,这主要得益于其消除了重复推导和检查的过程。例如,在一个线性代数选择题中,Mobius用更少的token完成了相同的推理步骤。

模型以bfloat16权重格式发布,支持多种推理框架,包括LMDeployTransformersvLLMSGLang。推荐使用MTP(Multi-Token Prediction)投机解码配置以发挥最佳性能,示例命令展示了单GPU部署方式。书生团队建议使用`top_p=1`、`top_k=50`、`temperature=0.8`等采样参数。

这一发布对AI产业具有多重意义。首先,知识-推理解耦架构可能降低推理时的计算开销,使大模型在相同硬件上服务更多请求,对基础设施层的算力效率提升至关重要。其次,动态潜在推理减少了对长思维链(CoT)的依赖,可能改变模型在复杂任务上的推理模式,影响模型层的设计趋势。最后,科学任务上的显著进步,暗示该架构在专业领域(如生物、化学)的潜力,可能加速应用层的落地。

值得注意的是,Mobius架构由书生团队自研,并通过Xtuner和LMDeploy工具链实现,体现了其在模型训练与部署工具链上的整合能力。随着推理效率成为大模型规模化部署的关键瓶颈,这类创新或将为行业提供新的优化方向。