書生團隊(InternLM)在 Hugging Face 上釋出了 Intern-S2-Mobius,一個基於 Mobius-v0 架構的 35B 引數多模態基礎模型(支援影像-文本到文本任務)。該模型從 Qwen3.5-35B 持續預訓練而來,並經過 SFT 與 RL 後訓練,在保持下游能力的同時,實現了接近 4 倍 的端到端推理加速。
Mobius 架構的核心創新在於將知識儲存與推理計算解耦。傳統 Transformer 模型將知識儲存與推理計算逐層繫結,而 Mobius 將知識組織為全域性共享的 Memory,讓多個 Reasoner 迭代地查詢並精煉隱藏狀態。這種設計賦予了模型兩個原生能力:Backward Residual Connection(後向殘差連線),使推理階段可以訪問超越區域性層層次的知識;以及 Dynamic Latent Reasoning(動態潛在推理),將思考、精煉和多 token 預測內化到高密度連續狀態中。
在推理效率方面,Intern-S2-Mobius 在推理基準上達到了與 Qwen3.5-35B 相當或更強的分數,同時產生明顯更短的推理軌跡和更高的請求吞吐量,據技術報告稱,端到端推理加速接近 4 倍。在通用推理基準上,該模型相比 Qwen3.5-35B 提升了平均分,並在科學任務(如 Biology-Instructions、Mol-Instructions、MolecularIQ)上表現出顯著增益。
模型評估使用 OpenCompass 進行,文本基準中,MMLU Pro、SimpleQA 和 HLE 的最大推理長度為 64K tokens,其餘文本基準為 128K tokens。官方推薦取樣引數為 top_p=0.95、top_k=50、min_p=0.0、temperature=0.8。部署方面,Intern-S2-Mobius 支援 LMDeploy、Transformer 和 vLLM 等主流推理框架。
這一發布對 AI 產業具有多重含義。首先,知識-推理解耦架構為提升大模型推理效率提供了新思路,可能降低推理階段的算力成本,對依賴大規模部署的 AI 應用具有吸引力。其次,模型基於 Qwen3.5-35B 持續預訓練,體現了開源社群在基座模型之上的二次開發潛力,有助於推動模型生態的多樣化。最後,科學任務上的顯著增益表明,此類架構在專業領域(如生物、化學)可能具有獨特優勢,為垂直應用開闢了空間。不過,該模型仍處於釋出初期,實際部署效果與長期穩定性有待進一步驗證。