上海人工智能实验室书生团队(InternLM)近日发布了其最新的多模态基础模型 Intern-S2-Preview-397B,总参数量达到 404B,定位为面向科学智能和长周期智能体的最强能力模型。该模型已在 Hugging Face 等平台开源,采用 Apache 2.0 许可证。
Intern-S2-Preview-397B 在三个关键维度上进行了扩展:预训练、强化学习任务覆盖和交互式智能体环境。团队介绍,该模型采用了一种新的视觉语言预训练范式,能够直接从科学文献的原始页面进行学习,在不经过中间解析的情况下,在共享表示空间中联合建模符号语义和视觉关系。这种方法保留了文本与视觉的对应关系,增强了空间和视觉推理能力,并提高了数据效率。
在科学模态推理与生成方面,模型在超过 20 个科学领域中扩展了多样化的科学强化学习任务,并进行联合训练。这使得 Intern-S2-Preview-397B 在开源模型中取得了领先的通用推理性能,并在生物分子相互作用设计和材料结构生成等专业科学任务上表现出色。
模型还具备通用科学长周期智能体能力。通过将多个智能体框架连接到大规模沙盒环境进行黑盒智能体强化学习,Intern-S2-Preview-397B 提升了泛化能力,并在通用和科学领域的长期任务中提高了能力上限。
在性能评估方面,团队使用 OpenCompass、VLMEvalKit 和 AgentCompass 等工具,在通用数据集和科学数据集上进行了测试。对于文本推理基准,模型以最大 256K tokens 的推理长度进行评估;对于多模态基准,则以最大 64K tokens 的推理长度进行评估。结果显示,Intern-S2-Preview-397B 在多个基准上达到了开源模型中的最佳性能。
该模型的发布标志着开源大模型在科学智能领域迈出了重要一步。其创新的预训练范式直接处理科学文献原始页面,避免了传统 OCR 或结构化解析的信息损失,有望显著提升 AI 在科研文献理解、实验设计辅助等场景的应用效果。同时,长周期智能体能力的引入,使得模型能够处理更复杂的、需要多步推理和交互的科研任务。
对于 AI 产业而言,Intern-S2-Preview-397B 展示了模型层竞争的另一个重要方向——垂直领域的深度专业化。不同于追求通用对话能力的通用大模型,该模型聚焦科学智能,通过针对性的预训练和强化学习策略,在特定领域实现突破。这可能推动更多面向医疗、材料、生物等专业领域的专用大模型出现,并加速 AI 在科学研究中的实际落地。