面壁智能(OpenBMB)于 Hugging Face 发布 JustRL-II 基座模型(openbmb/JustRL-II-base-model),作为其技术博客《JustRL II:用评论家将小模型扩展至 128K 推理》中数学推理案例研究的强化学习初始化检查点。该模型并非强化学习后的最终模型,而是所有实验(标准 GRPO 基线、完整 JustRL-II 配方及消融实验)的起点,旨在让研究者能从完全相同的初始权重复现博客中的数据流程与训练配方。
据模型卡介绍,该模型是一个已训练为生成长思维链(long chain-of-thought)响应的小型语言模型,在最终答案前会输出思考过程。在强化学习前,该模型在博客的评估协议下(对采样响应取平均,128k token 生成预算)于 AIME 2025 上得分约 61%。从该检查点出发,完整 JustRL-II 配方约 300 步强化学习后达到 81%,而相同数据上的标准 GRPO 基线则稳定在约 74%。
模型卡还透露,博客数据流程中的难度重新校准步骤(第三阶段)通过每个问题对该检查点进行 8 次 rollout 来计算,因此发布训练集的难度分层反映了该模型的通过率。
模型架构与使用
该模型采用 Llama 风格架构(LlamaForCausalLM),可通过标准 transformers 库加载,权重为 bf16 精度,并附带分词器及支持思考模式的聊天模板。模型配置了两个结束符 ID(eos_token_id = [1, 130073]),调用生成或服务引擎时需同时传入。config.json 中 max_position_embeddings 设为 65536,而博客中的 RL 运行使用 128k token 生成预算,长上下文服务设置需参考博客。
模型卡提供了使用示例,包括通过 vLLM 或 SGLang 作为标准 Llama 架构模型进行服务。模型用途明确为复现 JustRL-II 配方及其消融实验,以及研究小模型的长思维链 RL,涵盖信用分配、评论家诊断和数据难度校准。该检查点未针对通用助手用途进行对齐,仅评估了数学推理能力,可能产生极长输出,需根据硬件设置生成预算。
JustRL-II 配方要点
博客所述配方使用带评论家的 GRPO 方法训练该检查点。数据方面,采用三阶段流程审计约 10 万个开源数学问题(来自 DAPO-Math、DeepScaleR、DeepMath),检查可解性,用独立强模型解决方案重新核对标签,并移除该检查点已能 8/8 解决的问题,最终训练集保留 32,412 个问题。算法上保留 GRPO 的组结构和动态采样,学习价值模型(从策略初始化,偏差校准至池通过率)通过 GAE 和长度自适应 λ 提供 token 级优势,尾部过度长度控制限制过长 rollout。Rollout 阶段每个提示采样 8 次,温度 1.0,128k token 预算,用 math-verify 变体评分。
该模型的发布为 AI 研究者提供了可复现的基准,有助于推动小模型高效推理与强化学习算法的透明研究。对于关注 AI 产业应用与效率的投资者而言,此类开源研究可能影响未来模型训练与推理的成本结构,值得持续跟踪。