書生 InternLM 團隊在 Hugging Face 上線了新一代多模態基礎模型 Intern-S2-397B,模型卡顯示其總引數量為 403B,採用 Apache-2.0 許可,任務型別標註為影像-文本到文本,定位是面向科學智慧與長週期智慧體的多模態基礎模型。
按照官方介紹,Intern-S2-397B 的能力擴充套件沿三條主線展開:預訓練、強化學習任務覆蓋,以及互動式智慧體環境。團隊稱,通過把新的視覺-語言預訓練範式、大規模多工強化學習與長週期智慧體強化學習結合起來,模型在通用推理、科學問題求解和智慧體能力上實現了階躍式提升。
其中最值得關注的是預訓練範式的變化。Intern-S2-397B 不再依賴先把科學文獻解析成中間格式,而是直接以科學文獻的原始頁面為學習物件,在共享表示空間裡同時建模符號語義與視覺關係。官方稱,這種做法保留了文本與視覺之間的對應關係,增強了空間與視覺推理能力,也提升了資料效率。對科研場景而言,圖表、公式、版式本身往往承載關鍵資訊,直接學習原始頁面意味著模型有機會捕捉到傳統文本抽取流程容易丟失的部分。
在科學模態的推理與生成方面,團隊把強化學習任務擴充套件到 20 多個領域並聯合訓練,官方稱其在開源模型中取得領先的通用推理表現,並在生物分子相互作用設計、材料結構生成等專業科學任務上取得較強結果。這類任務通常對結構化輸出和領域約束要求較高,能否穩定生成可用結果,是衡量科學模型實用性的關鍵。
智慧體方向則通過把多個智慧體框架接入大規模沙盒環境,進行黑盒式智慧體強化學習。官方表示,這一路徑提升了模型的泛化能力,並抬高了通用與科學領域長週期任務的能力上限。長週期任務意味著模型需要在多步操作、工具呼叫和中間狀態反饋中保持目標一致性,這也是當前智慧體從演示走向實用的主要瓶頸之一。
評測方面,團隊在通用與科學資料集上對 Intern-S2-397B 進行了測試,並與近期多模態模型和大語言模型做了對比,評測使用 OpenCompass、VLMEvalKit 和 AgentCompass 三套工具。文本推理基準的最大推理長度為 256K tokens,多模態基準為 64K tokens。官方說明中,下劃線表示開源模型中的最佳表現,加粗表示所有模型中的最佳表現。
部署層面,模型支援 LMDeploy、vLLM、SGLang 等主流推理框架,官方提供了對應的部署示例。推薦取樣引數為 top_p 0.95、top_k 50、min_p 0.0、temperature 0.8。模型還支援工具呼叫,可通過相容 OpenAI 的介面呼叫外部工具與 API,例如查詢天氣等外部資訊。
從產業視角看,這條釋出延續了開源模型向科學計算與智慧體兩條高價值賽道延伸的趨勢。科學智慧對應的是研發效率與專業資料壁壘,長週期智慧體對應的是任務自動化與工具生態,兩者都對算力、推理框架和評測體系提出更高要求。對關注 AI 產業鏈的讀者而言,值得跟蹤的是這類模型在真實科研與工程流程中的可用性,以及開源許可下企業與研究機構的採用節奏。