上海人工智慧實驗室書生團隊(InternLM)近日釋出了其最新的多模態基礎模型 Intern-S2-Preview-397B,總引數量達到 404B,定位為面向科學智慧和長週期智慧體的最強能力模型。該模型已在 Hugging Face 等平台開源,採用 Apache 2.0 許可證。

Intern-S2-Preview-397B 在三個關鍵維度上進行了擴充套件:預訓練強化學習任務覆蓋互動式智慧體環境。團隊介紹,該模型採用了一種新的視覺語言預訓練範式,能夠直接從科學文獻的原始頁面進行學習,在不經過中間解析的情況下,在共享表示空間中聯合建模符號語義和視覺關係。這種方法保留了文本與視覺的對應關係,增強了空間和視覺推理能力,並提高了資料效率。

在科學模態推理與生成方面,模型在超過 20 個科學領域中擴充套件了多樣化的科學強化學習任務,並進行聯合訓練。這使得 Intern-S2-Preview-397B 在開源模型中取得了領先的通用推理效能,並在生物分子相互作用設計和材料結構生成等專業科學任務上表現出色。

模型還具備通用科學長週期智慧體能力。通過將多個智慧體框架連線到大規模沙盒環境進行黑盒智慧體強化學習,Intern-S2-Preview-397B 提升了泛化能力,並在通用和科學領域的長期任務中提高了能力上限。

在效能評估方面,團隊使用 OpenCompassVLMEvalKitAgentCompass 等工具,在通用資料集和科學資料集上進行了測試。對於文本推理基準,模型以最大 256K tokens 的推理長度進行評估;對於多模態基準,則以最大 64K tokens 的推理長度進行評估。結果顯示,Intern-S2-Preview-397B 在多個基準上達到了開源模型中的最佳效能。

該模型的釋出標誌著開源大模型在科學智慧領域邁出了重要一步。其創新的預訓練範式直接處理科學文獻原始頁面,避免了傳統 OCR 或結構化解析的資訊損失,有望顯著提升 AI 在科研文獻理解、實驗設計輔助等場景的應用效果。同時,長週期智慧體能力的引入,使得模型能夠處理更復雜的、需要多步推理和互動的科研任務。

對於 AI 產業而言,Intern-S2-Preview-397B 展示了模型層競爭的另一個重要方向——垂直領域的深度專業化。不同於追求通用對話能力的通用大模型,該模型聚焦科學智慧,通過針對性的預訓練和強化學習策略,在特定領域實現突破。這可能推動更多面向醫療、材料、生物等專業領域的專用大模型出現,並加速 AI 在科學研究中的實際落地。