面壁智慧(OpenBMB)於 Hugging Face 釋出 JustRL-II 基座模型(openbmb/JustRL-II-base-model),作為其技術部落格《JustRL II:用評論家將小模型擴充套件至 128K 推理》中數學推理案例研究的強化學習初始化檢查點。該模型並非強化學習後的最終模型,而是所有實驗(標準 GRPO 基線、完整 JustRL-II 配方及消融實驗)的起點,旨在讓研究者能從完全相同的初始權重複現部落格中的資料流程與訓練配方。
據模型卡介紹,該模型是一個已訓練為生成長思維鏈(long chain-of-thought)響應的小型語言模型,在最終答案前會輸出思考過程。在強化學習前,該模型在部落格的評估協議下(對取樣響應取平均,128k token 生成預算)於 AIME 2025 上得分約 61%。從該檢查點出發,完整 JustRL-II 配方約 300 步強化學習後達到 81%,而相同資料上的標準 GRPO 基線則穩定在約 74%。
模型卡還透露,部落格資料流程中的難度重新校準步驟(第三階段)通過每個問題對該檢查點進行 8 次 rollout 來計算,因此釋出訓練集的難度分層反映了該模型的通過率。
模型架構與使用
該模型採用 Llama 風格架構(LlamaForCausalLM),可通過標準 transformers 庫載入,權重為 bf16 精度,並附帶分詞器及支援思考模式的聊天模板。模型配置了兩個結束符 ID(eos_token_id = [1, 130073]),呼叫生成或服務引擎時需同時傳入。config.json 中 max_position_embeddings 設為 65536,而部落格中的 RL 執行使用 128k token 生成預算,長上下文服務設定需參考部落格。
模型卡提供了使用示例,包括通過 vLLM 或 SGLang 作為標準 Llama 架構模型進行服務。模型用途明確為復現 JustRL-II 配方及其消融實驗,以及研究小模型的長思維鏈 RL,涵蓋信用分配、評論家診斷和資料難度校準。該檢查點未針對通用助手用途進行對齊,僅評估了數學推理能力,可能產生極長輸出,需根據硬體設定生成預算。
JustRL-II 配方要點
部落格所述配方使用帶評論家的 GRPO 方法訓練該檢查點。資料方面,採用三階段流程審計約 10 萬個開源數學問題(來自 DAPO-Math、DeepScaleR、DeepMath),檢查可解性,用獨立強模型解決方案重新核對標籤,並移除該檢查點已能 8/8 解決的問題,最終訓練集保留 32,412 個問題。演算法上保留 GRPO 的組結構和動態取樣,學習價值模型(從策略初始化,偏差校準至池通過率)通過 GAE 和長度自適應 λ 提供 token 級優勢,尾部過度長度控制限制過長 rollout。Rollout 階段每個提示取樣 8 次,溫度 1.0,128k token 預算,用 math-verify 變體評分。
該模型的釋出為 AI 研究者提供了可復現的基準,有助於推動小模型高效推理與強化學習演算法的透明研究。對於關注 AI 產業應用與效率的投資者而言,此類開源研究可能影響未來模型訓練與推理的成本結構,值得持續跟蹤。