書生 InternLM 團隊在 Hugging Face 上線了 Intern-S1-Pro,這是一款總引數規模達到 1T 的多模態科學推理模型,採用 MoE(混合專家)架構,共配置 512 個專家,每個 token 啟用其中 8 個專家,對應 22B 啟用引數。模型以 Apache-2.0 許可釋出,支援影像-文本到文本任務,配套提供 Github 倉庫、模型合集、技術報告以及線上聊天入口。
從定位看,Intern-S1-Pro 的核心賣點是「科學推理」。官方介紹稱,該模型在高階推理基準上表現處於第一梯隊,並在化學、材料、生命科學、地球科學等關鍵 AI4Science 領域取得領先結果,同時維持了較強的通用多模態與文本能力。這意味著它並非只做單一學科問答,而是試圖在通用能力與專業科學任務之間取得平衡。
訓練層面,團隊披露了兩項關鍵設計。其一是 STE 路由,即為路由器訓練引入稠密梯度,配合分組路由,以提升萬億級 MoE 訓練的收斂穩定性與專家並行負載均衡;其二是 Fourier 位置編碼(FoPE) 與升級後的時間序列建模,用於更好地表徵物理訊號,並支援從 10^0 到 10^6 個點的長、異質時間序列。這兩點指向同一個工程難題:引數規模跨過萬億門檻後,訓練效率與訊號建模能力往往比單純堆引數更能決定最終效果。
部署方面,官方明確提示,用原生 Hugging Face 前向方法執行萬億引數模型存在困難,強烈建議使用 LMDeploy、vLLM 或 SGLang 等推理引擎託管,並通過 API 訪問。模型還支援工具呼叫,且相容 OpenAI API 介面風格,開發者可用熟悉的語法結構接入外部工具與函式。官方給出的推薦取樣引數為 top_p=0.95、top_k=50、min_p=0.0、temperature=0.8。
把這條釋出放到產業背景裡看,有幾個角度值得關注。第一,開源模型正在從「通用對話」向「科學專用」延伸,AI4Science 被視為大模型落地的高價值場景之一,化學、材料、生命科學等方向對推理深度和長序列訊號處理的要求,恰好是 MoE 大模型可以發揮規模優勢的地方。第二,萬億級 MoE 的開源釋出,對推理側的算力與工程能力提出了更高要求,模型能否被高效託管,直接決定其被研究者與開發者採用的速度。第三,科學推理模型的競爭,正在從單一榜單分數轉向「通用能力 + 專業領域 + 工程可用性」的綜合比拼,這對上游算力、推理框架以及下游科研工具鏈都會帶來連鎖影響。
目前官方尚未在公開材料中給出具體的商業合作或定價資訊,模型以開源許可釋出,後續在科研社群的實際採用情況、以及與其他開源及閉源科學模型的對比較量,將是觀察其影響力的關鍵。