大模型竞争的主线正在从预训练堆叠转向后训练强化学习(RL)。随着预训练边际收益递减,数学推理、代码生成、复杂决策、长时序Agent等高阶能力越来越依赖RL来激发。RL通过生成、执行、反馈和奖励,让模型持续学习推理、规划与自我纠错,大模型发展由此从“一次性训练”进入“持续训练”。SemiAnalysis指出,当RL成为模型能力持续Scaling的关键,竞争的就不只是算法,还有支撑模型持续生成、训练和更新的AI基础设施系统。

智谱近期的模型迭代为观察后训练RL提供了一个窗口。智谱公告显示,GLM-5.3GLM-5.2在相同基座上推进强化学习,通过后训练Scaling持续提升模型智能上界。以GLM-5.2为例,其在SWE-bench Pro取得62.1分Terminal-Bench 3.0达到81.0分,核心驱动力正是面向长时序、多步骤、工具联动场景的RL训练。这意味着,复杂推理和Agent能力的提升,正越来越依赖强化学习。

这一变化正在影响AI产业链分工方式:模型厂商不再只是单独推进算法,而是需要与AI基础设施共同服务于“智能持续生产”。目前,GLM-5系列DeepSeek R系列等主流推理模型均已部署于九章智算云,实现规模化Token生产。九章智算云与模型厂商形成了算法与工程系统双向RL Scaling的协作模式:模型厂商持续挑战RL算法和策略边界,九章智算云则持续打磨适配的算力调度、推理服务和状态管理,实现工业级应用。模型算法再进化,进而提出更高的基础设施要求,而基础设施的持续迭代又为更大规模RL实现打开空间。

RL与传统预训练的核心差异在于改变了训练系统的结构。一个完整的RL系统通常由三部分组成:GeneratorEnvironmentTrainer。Generator接收Prompt并通过推理生成Rollout;Environment执行代码、工具调用或任务模拟并返回Reward;Trainer依据Rollout和Reward更新模型权重,再将新权重回传Generator,形成持续闭环。与预训练依赖固定数据集不同,RL的训练数据由模型实时生成,因此训练与推理第一次真正形成了连续生产关系。

问题也因此出现:如果Trainer每秒能够消费100个样本,而Generator只能生成60个,训练算力就会闲置;反之则会造成Rollout堆积、数据陈旧,形成Policy Staleness。因此,RL基础设施优化的核心不再是单点GPU利用率,而是Trainer ThroughputEffective Generator Throughput的动态匹配。九章智算云正是围绕这一问题构建RL工程化基础设施:将Generator、Environment和Trainer纳入统一工作流,通过全局动态调度适应不同阶段的资源需求——生成环节成为瓶颈时增加推理资源,训练进入高峰时重新分配算力,Environment等待时释放闲置GPU。由此,AI调度对象从“哪台机器有空闲GPU”升级为“模型、轨迹、状态和下一步计算应该在哪里”。

九章智算云与中国人民大学STILL项目团队联合发布的《An Empirical Study on Eliciting and Improving R1-like Reasoning Models》验证了这一机制。研究显示,Qwen2.5-32BDeepSeek-R1-Distill-Qwen-1.5B等模型均可通过持续RL迭代释放潜在推理能力,后者在AIME 2024上的准确率达到39.33%。研究同时表明,On-policy学习是持续提升性能的重要机制,而单纯奖励更长回答容易产生“length hacking”;通过动态更新Reward Model的Cooper方法,可以缓解Reward Hacking,改善端到端RL效果。这说明RL绝非简单的增量训练,而是策略、生成、环境、训练和反馈高度耦合的系统工程。

计算之外,运行状态本身也是基础设施的核心资源。Agent交互产生的上下文与KV Cache、RL生成的轨迹数据与奖励信号、实时更新的模型权重,共同构成AI持续进化的状态资产。九章智算云依托DingoFS分布式文件底座、DFKV分布式缓存、全域零拷贝链路、RDMA高速网络等底层技术,重新组织数据与状态流转。零拷贝缩短数据传输路径、减少CPU参与,降低RL闭环中的非计算开销;DFKV则将KV Cache从单GPU临时缓存升级为可定位、可迁移、可跨任务复用的状态资源。

基于此,九章智算云实现“训推一致”的核心思路是:不是简单共享训练与推理算力,而是让两者共享一套能够同时感知计算、数据、状态和工作流的统一基础设施。在RL体系中,Generator本身就是训练闭环的一部分;在Agent运行场景中,上下文与KV Cache又是任务持续运行的核心状态,二者天然深度耦合。这意味着,推理效率正在直接前置为训练效率:每一次高效Token生成、每一次KV Cache复用、每一次精准调度,都可能转化为模型迭代效率的提升。SemiAnalysis RL系统专项分析指出,只有实现训推吞吐与系统状态高度匹配的基础设施,才能充分释放RL的性能潜力。

“训推一致”的系统能力带来显著好处:加速推理优化技术进入生产级别,反过来影响训练效率,促成Token成本的直线下降。其中与MoE架构、推理优化、模型量化、模型架构和硬件协同设计等技术融合尤为关键。如Prefill与Decode具有不同的计算特征,PD分离可以将两类负载匹配到更合适的资源池;Chunked Prefill通过拆解超长上下文,缓解不同阶段的资源竞争;Speculative Decoding则由小模型生成候选Token、大模型批量验证,降低逐Token串行计算带来的开销。这些技术本质在解决同一个问题:让有限GPU生产更多有效Token。

在九章智算云体系中,Generator产生的Token不是最终答案,而是下一轮训练的原材料。Generator效率越高,同等算力就能生成更多Rollout;KV Cache复用减少重复Prefill;PD分离与动态调度则进一步提升计算与带宽匹配效率。训练与推理优化最终统一为AI基础设施生产级目标:单位算力的有效Token产出率,以及Token向模型智能的转化效率。

这一能力也将从大模型延伸至具身智能。Agent的工具调用、多轮决策,以及机器人的感知、推理、行动与反馈,本质都是动态试错和持续学习的RL闭环。未来,迭代环境将从代码沙箱、工具调用场景,延伸至模拟器、真实机器人与物理世界,但基础设施需求依然一致:弹性算力、实时推理、状态管理、高频反馈和持续迭代。随着行业从大规模训练转向后训练强化学习,RL正在从单一模型训练算法,成为连接大模型、Agent与具身智能的通用技术底座。