書生團隊(InternLM)今日在Hugging Face釋出新模型Intern-S2-Mobius,這是一個35B引數的基礎模型,基於Mobius-v0架構構建,由XtunerLMDeploy實現。該模型的核心創新在於將知識儲存與推理計算解耦,通過全域性共享的記憶庫和多個推理器的迭代查詢,實現了更高效的推理。據技術報告,其端到端推理速度相比傳統Transformer基線提升近4倍,同時在下游任務上保持甚至超越原有效能。

Intern-S2-Mobius從Qwen3.5-35B持續預訓練而來,並經過監督微調(SFT)和強化學習(RL)後訓練。其架構設計摒棄了傳統Transformer中逐層繫結知識儲存與推理計算的方式,而是將知識組織為全域性共享的Memory,讓多個Reasoner迭代查詢並精煉隱藏狀態。這種分離帶來了兩個原生能力:Backward Residual Connection(後向殘差連線),使推理階段能訪問超越區域性層層級的知識;以及Dynamic Latent Reasoning(動態潛在推理),將思考、精煉和多token預測內化為高密度連續狀態。

在效能評測中,Intern-S2-Mobius在通用推理基準上相比Qwen3.5-35B基線取得了更高的平均分,並在科學任務如Biology-InstructionsMol-InstructionsMolecularIQ上顯示出大幅提升。模型在推理時生成的推理軌跡更短,請求吞吐量更高,這主要得益於其消除了重複推導和檢查的過程。例如,在一個線性代數選擇題中,Mobius用更少的token完成了相同的推理步驟。

模型以bfloat16權重格式釋出,支援多種推理框架,包括LMDeployTransformersvLLMSGLang。推薦使用MTP(Multi-Token Prediction)投機解碼配置以發揮最佳效能,示例命令展示了單GPU部署方式。書生團隊建議使用`top_p=1`、`top_k=50`、`temperature=0.8`等取樣引數。

這一發布對AI產業具有多重意義。首先,知識-推理解耦架構可能降低推理時的計算開銷,使大模型在相同硬體上服務更多請求,對基礎設施層的算力效率提升至關重要。其次,動態潛在推理減少了對長思維鏈(CoT)的依賴,可能改變模型在複雜任務上的推理模式,影響模型層的設計趨勢。最後,科學任務上的顯著進步,暗示該架構在專業領域(如生物、化學)的潛力,可能加速應用層的落地。

值得注意的是,Mobius架構由書生團隊自研,並通過Xtuner和LMDeploy工具鏈實現,體現了其在模型訓練與部署工具鏈上的整合能力。隨著推理效率成為大模型規模化部署的關鍵瓶頸,這類創新或將為行業提供新的最佳化方向。