書生團隊今日釋出新一代多模態基礎模型 Intern-S2-Mobius,引數規模 35B,基於自研 Mobius-v0 架構構建,並已在 Hugging Face 上開源權重與部署程式碼。該模型最突出的特點是採用知識-推理解耦設計,將知識儲存與推理計算分離,從而在保持甚至提升推理效能的同時,實現接近 4 倍 的端到端推理加速。
與傳統的 Transformer 模型將知識儲存與推理計算逐層繫結不同,Mobius 架構將知識組織進一個全域性共享的 Memory,讓多個 Reasoner 迭代地查詢並精煉隱藏狀態。這種設計賦予模型兩項原生能力:Backward Residual Connection,使淺層與深層推理階段都能訪問跨層知識,而不侷限於前向逐層資訊流;以及 Dynamic Latent Reasoning,通過迴圈潛在迭代在解碼前精煉連續隱藏狀態,將部分思考過程內化,減少對長鏈式思維(CoT)的依賴,並動態分配計算資源。
Intern-S2-Mobius 從 Qwen3.5-35B 持續預訓練而來,並進一步經過監督微調(SFT)與強化學習(RL)後訓練。在推理基準上,模型達到與 Qwen3.5-35B 相當或更強的分數,同時生成更短的推理軌跡、更高的請求吞吐量,從而帶來近 4 倍的端到端推理加速。在通用推理基準上,模型相對基線提升了平均分,並在科學任務(如 Biology-Instructions、Mol-Instructions、MolecularIQ)上取得大幅增益。
該模型支援影像-文本到文本的多模態任務,可處理影像與文本輸入。部署方面,官方提供了 LMDeploy、Transformers、vLLM、SGLang 等主流推理框架的參考配置,並推薦使用 MTP 投機解碼以進一步提升效能。模型以 bfloat16 權重儲存,建議取樣引數為 top_p=1、top_k=50、min_p=0.0、temperature=0.8。
從產業視角看,這一發布對 AI 基礎設施層的推理效率與成本控制具有直接意義。知識-推理解耦架構若能在大規模部署中穩定復現近 4 倍的加速,將可能降低推理環節的算力消耗與延遲,對依賴大規模模型推理的應用場景(如智慧助手、科學計算)帶來積極影響。同時,該模型基於 Qwen3.5 持續預訓練,也體現了開源社群在模型架構創新上的持續探索,為後續模型設計與推理框架最佳化提供了新的思路。