大模型競爭的主線正在從預訓練堆疊轉向後訓練強化學習(RL)。隨著預訓練邊際收益遞減,數學推理、程式碼生成、複雜決策、長時序Agent等高階能力越來越依賴RL來激發。RL通過生成、執行、反饋和獎勵,讓模型持續學習推理、規劃與自我糾錯,大模型發展由此從“一次性訓練”進入“持續訓練”。SemiAnalysis指出,當RL成為模型能力持續Scaling的關鍵,競爭的就不只是演算法,還有支撐模型持續生成、訓練和更新的AI基礎設施系統。
智譜近期的模型迭代為觀察後訓練RL提供了一個視窗。智譜公告顯示,GLM-5.3與GLM-5.2在相同基座上推進強化學習,通過後訓練Scaling持續提升模型智慧上界。以GLM-5.2為例,其在SWE-bench Pro取得62.1分、Terminal-Bench 3.0達到81.0分,核心驅動力正是面向長時序、多步驟、工具聯動場景的RL訓練。這意味著,複雜推理和Agent能力的提升,正越來越依賴強化學習。
這一變化正在影響AI產業鏈分工方式:模型廠商不再只是單獨推進演算法,而是需要與AI基礎設施共同服務於“智慧持續生產”。目前,GLM-5系列、DeepSeek R系列等主流推理模型均已部署於九章智算雲,實現規模化Token生產。九章智算雲與模型廠商形成了演算法與工程系統雙向RL Scaling的協作模式:模型廠商持續挑戰RL演算法和策略邊界,九章智算雲則持續打磨適配的算力排程、推理服務和狀態管理,實現工業級應用。模型演算法再進化,進而提出更高的基礎設施要求,而基礎設施的持續迭代又為更大規模RL實現開啟空間。
RL與傳統預訓練的核心差異在於改變了訓練系統的結構。一個完整的RL系統通常由三部分組成:Generator、Environment和Trainer。Generator接收Prompt並通過推理生成Rollout;Environment執行程式碼、工具呼叫或任務模擬並返回Reward;Trainer依據Rollout和Reward更新模型權重,再將新權重回傳Generator,形成持續閉環。與預訓練依賴固定資料集不同,RL的訓練資料由模型即時生成,因此訓練與推理第一次真正形成了連續生產關係。
問題也因此出現:如果Trainer每秒能夠消費100個樣本,而Generator只能生成60個,訓練算力就會閒置;反之則會造成Rollout堆積、資料陳舊,形成Policy Staleness。因此,RL基礎設施最佳化的核心不再是單點GPU利用率,而是Trainer Throughput與Effective Generator Throughput的動態匹配。九章智算雲正是圍繞這一問題構建RL工程化基礎設施:將Generator、Environment和Trainer納入統一工作流,通過全域性動態排程適應不同階段的資源需求——生成環節成為瓶頸時增加推理資源,訓練進入高峰時重新分配算力,Environment等待時釋放閒置GPU。由此,AI排程物件從“哪台機器有空閒GPU”升級為“模型、軌跡、狀態和下一步計算應該在哪裡”。
九章智算雲與中國人民大學STILL專案團隊聯合釋出的《An Empirical Study on Eliciting and Improving R1-like Reasoning Models》驗證了這一機制。研究顯示,Qwen2.5-32B、DeepSeek-R1-Distill-Qwen-1.5B等模型均可通過持續RL迭代釋放潛在推理能力,後者在AIME 2024上的準確率達到39.33%。研究同時表明,On-policy學習是持續提升效能的重要機制,而單純獎勵更長回答容易產生“length hacking”;通過動態更新Reward Model的Cooper方法,可以緩解Reward Hacking,改善端到端RL效果。這說明RL絕非簡單的增量訓練,而是策略、生成、環境、訓練和反饋高度耦合的系統工程。
計算之外,執行狀態本身也是基礎設施的核心資源。Agent互動產生的上下文與KV Cache、RL生成的軌跡資料與獎勵訊號、即時更新的模型權重,共同構成AI持續進化的狀態資產。九章智算雲依託DingoFS分散式檔案底座、DFKV分散式快取、全域零複製鏈路、RDMA高速網路等底層技術,重新組織資料與狀態流轉。零複製縮短資料傳輸路徑、減少CPU參與,降低RL閉環中的非計算開銷;DFKV則將KV Cache從單GPU臨時快取升級為可定位、可遷移、可跨任務複用的狀態資源。
基於此,九章智算雲實現“訓推一致”的核心思路是:不是簡單共享訓練與推理算力,而是讓兩者共享一套能夠同時感知計算、資料、狀態和工作流的統一基礎設施。在RL體系中,Generator本身就是訓練閉環的一部分;在Agent執行場景中,上下文與KV Cache又是任務持續執行的核心狀態,二者天然深度耦合。這意味著,推理效率正在直接前置為訓練效率:每一次高效Token生成、每一次KV Cache複用、每一次精準排程,都可能轉化為模型迭代效率的提升。SemiAnalysis RL系統專項分析指出,只有實現訓推吞吐與系統狀態高度匹配的基礎設施,才能充分釋放RL的效能潛力。
“訓推一致”的系統能力帶來顯著好處:加速推理最佳化技術進入生產級別,反過來影響訓練效率,促成Token成本的直線下降。其中與MoE架構、推理最佳化、模型量化、模型架構和硬體協同設計等技術融合尤為關鍵。如Prefill與Decode具有不同的計算特徵,PD分離可以將兩類負載匹配到更合適的資源池;Chunked Prefill通過拆解超長上下文,緩解不同階段的資源競爭;Speculative Decoding則由小模型生成候選Token、大模型批次驗證,降低逐Token序列計算帶來的開銷。這些技術本質在解決同一個問題:讓有限GPU生產更多有效Token。
在九章智算雲體系中,Generator產生的Token不是最終答案,而是下一輪訓練的原材料。Generator效率越高,同等算力就能生成更多Rollout;KV Cache複用減少重複Prefill;PD分離與動態排程則進一步提升計算與頻寬匹配效率。訓練與推理最佳化最終統一為AI基礎設施生產級目標:單位算力的有效Token產出率,以及Token向模型智慧的轉化效率。
這一能力也將從大模型延伸至具身智慧。Agent的工具呼叫、多輪決策,以及機器人的感知、推理、行動與反饋,本質都是動態試錯和持續學習的RL閉環。未來,迭代環境將從程式碼沙箱、工具呼叫場景,延伸至模擬器、真實機器人與物理世界,但基礎設施需求依然一致:彈性算力、即時推理、狀態管理、高頻反饋和持續迭代。隨著行業從大規模訓練轉向後訓練強化學習,RL正在從單一模型訓練演算法,成為連線大模型、Agent與具身智慧的通用技術底座。