书生 InternLM 团队在 Hugging Face 上线了 Intern-S1-Pro,这是一款总参数规模达到 1T 的多模态科学推理模型,采用 MoE(混合专家)架构,共配置 512 个专家,每个 token 激活其中 8 个专家,对应 22B 激活参数。模型以 Apache-2.0 许可发布,支持图像-文本到文本任务,配套提供 Github 仓库、模型合集、技术报告以及在线聊天入口。
从定位看,Intern-S1-Pro 的核心卖点是「科学推理」。官方介绍称,该模型在高级推理基准上表现处于第一梯队,并在化学、材料、生命科学、地球科学等关键 AI4Science 领域取得领先结果,同时维持了较强的通用多模态与文本能力。这意味着它并非只做单一学科问答,而是试图在通用能力与专业科学任务之间取得平衡。
训练层面,团队披露了两项关键设计。其一是 STE 路由,即为路由器训练引入稠密梯度,配合分组路由,以提升万亿级 MoE 训练的收敛稳定性与专家并行负载均衡;其二是 Fourier 位置编码(FoPE) 与升级后的时间序列建模,用于更好地表征物理信号,并支持从 10^0 到 10^6 个点的长、异质时间序列。这两点指向同一个工程难题:参数规模跨过万亿门槛后,训练效率与信号建模能力往往比单纯堆参数更能决定最终效果。
部署方面,官方明确提示,用原生 Hugging Face 前向方法运行万亿参数模型存在困难,强烈建议使用 LMDeploy、vLLM 或 SGLang 等推理引擎托管,并通过 API 访问。模型还支持工具调用,且兼容 OpenAI API 接口风格,开发者可用熟悉的语法结构接入外部工具与函数。官方给出的推荐采样参数为 top_p=0.95、top_k=50、min_p=0.0、temperature=0.8。
把这条发布放到产业背景里看,有几个角度值得关注。第一,开源模型正在从「通用对话」向「科学专用」延伸,AI4Science 被视为大模型落地的高价值场景之一,化学、材料、生命科学等方向对推理深度和长序列信号处理的要求,恰好是 MoE 大模型可以发挥规模优势的地方。第二,万亿级 MoE 的开源发布,对推理侧的算力与工程能力提出了更高要求,模型能否被高效托管,直接决定其被研究者与开发者采用的速度。第三,科学推理模型的竞争,正在从单一榜单分数转向「通用能力 + 专业领域 + 工程可用性」的综合比拼,这对上游算力、推理框架以及下游科研工具链都会带来连锁影响。
目前官方尚未在公开材料中给出具体的商业合作或定价信息,模型以开源许可发布,后续在科研社区的实际采用情况、以及与其他开源及闭源科学模型的对比较量,将是观察其影响力的关键。