书生团队今日发布新一代多模态基础模型 Intern-S2-Mobius,参数规模 35B,基于自研 Mobius-v0 架构构建,并已在 Hugging Face 上开源权重与部署代码。该模型最突出的特点是采用知识-推理解耦设计,将知识存储与推理计算分离,从而在保持甚至提升推理性能的同时,实现接近 4 倍 的端到端推理加速。
与传统的 Transformer 模型将知识存储与推理计算逐层绑定不同,Mobius 架构将知识组织进一个全局共享的 Memory,让多个 Reasoner 迭代地查询并精炼隐藏状态。这种设计赋予模型两项原生能力:Backward Residual Connection,使浅层与深层推理阶段都能访问跨层知识,而不局限于前向逐层信息流;以及 Dynamic Latent Reasoning,通过循环潜在迭代在解码前精炼连续隐藏状态,将部分思考过程内化,减少对长链式思维(CoT)的依赖,并动态分配计算资源。
Intern-S2-Mobius 从 Qwen3.5-35B 持续预训练而来,并进一步经过监督微调(SFT)与强化学习(RL)后训练。在推理基准上,模型达到与 Qwen3.5-35B 相当或更强的分数,同时生成更短的推理轨迹、更高的请求吞吐量,从而带来近 4 倍的端到端推理加速。在通用推理基准上,模型相对基线提升了平均分,并在科学任务(如 Biology-Instructions、Mol-Instructions、MolecularIQ)上取得大幅增益。
该模型支持图像-文本到文本的多模态任务,可处理图像与文本输入。部署方面,官方提供了 LMDeploy、Transformers、vLLM、SGLang 等主流推理框架的参考配置,并推荐使用 MTP 投机解码以进一步提升性能。模型以 bfloat16 权重存储,建议采样参数为 top_p=1、top_k=50、min_p=0.0、temperature=0.8。
从产业视角看,这一发布对 AI 基础设施层的推理效率与成本控制具有直接意义。知识-推理解耦架构若能在大规模部署中稳定复现近 4 倍的加速,将可能降低推理环节的算力消耗与延迟,对依赖大规模模型推理的应用场景(如智能助手、科学计算)带来积极影响。同时,该模型基于 Qwen3.5 持续预训练,也体现了开源社区在模型架构创新上的持续探索,为后续模型设计与推理框架优化提供了新的思路。