以GLM-5為例,探究九章智算雲強化學習系統如何落地“訓推一致”
過去幾年,大模型競爭的主線很清晰:更大的模型、更多的數據和更強的GPU集群。但隨著預訓練邊際收益遞減,模型能力Scaling正從單純的預訓練堆疊向後訓練強化學習(RL)轉變,數學推理、代碼生成、複雜決策、長時序Agent等高階能力,越來越依賴後訓練強化學習(RL)激發。RL通過生成、執行、反饋和獎勵,讓模型持續學習推理、規劃與自我糾錯的能力。由此,大模型發展從“一次性訓練”進入“持續訓練”,模型能力Scaling也從預訓練延伸至生成、反饋和迭代全過程。
SemiAnalysis指出,當RL成為模型能力持續Scaling的關鍵,競爭的就不只是算法,還有支撐模型持續生成、訓練和更新的AI基礎設施系統。問題也隨之變成:當模型越依賴RL獲得能力,誰來支撐這種能力持續低成本地生產。從“模型+算力”到算法與AI基礎設施共同Scaling智譜近期的模型迭代,為觀察後訓練RL提供了一個窗口。智譜公告指出,GLM-5.3與GLM-5.2在相同基座上推進強化學習,通過後訓練Scaling持續提升模型智能上界。以GLM-5.2為例,其在SWE-bench Pro取得62.1分、Terminal-Bench 3.0達到81.
0分,核心驅動力正是面向長時序、多步驟、工具聯動場景的RL訓練。這意味著,複雜推理和Agent能力的提升,正越來越依賴強化學習。這一變化也正在影響AI產業鏈分工方式:模型廠商不再只是單獨推進算法,而是需要與AI基礎設施共同服務於“智能持續生產”。目前,GLM-5系列、DeepSeek R系列等主流推理模型均已部署於九章智算雲,實現規模化Token生產。不同於“模型+算力”的傳統產業關係,九章智算雲與模型廠商雙方形成了算法與工程系統雙向RL Scaling的協作模式:模型廠商持續挑戰RL算法和策略邊界,九章智算雲則持續打磨適配的算力調度、推理服務和狀態管理,實現工業級應用。
大規模應用的模型算法再進化,進而提出更高的基礎設施要求,而基礎設施的持續迭代又為更大規模RL實現打開空間。由此,模型廠商與AI基礎設施成為RL的一體兩面,RL從模型訓練中的單一算法環節,升級為AI雲必須具備的核心能力。模型、算力、數據、狀態和推理不再彼此割裂,而是共同構成一條持續運行的智能生產線。真正的問題也由“模型+算力”轉向如何讓算法與基礎設施協同Scaling,以“一條智能生產線”更低成本持續生產有效Token和模型能力。RL讓訓練與推理成為一條生產線強化學習與傳統預訓練的核心差異,不在於增加一種訓練算法,而在於改變了訓練系統的結構。
一個完整的RL系統通常由三部分組成:Generator、Environment和Trainer。Generator接收Prompt並通過推理生成Rollout;Environment執行代碼、工具調用或任務模擬並返回Reward;Trainer依據Rollout和Reward更新模型權重,再將新權重回傳Generator,形成Generate→Reward→Train→Update→Generate的持續閉環。與預訓練依賴固定數據集不同,RL的訓練數據由模型實時生成,因此訓練與推理第一次真正形成了連續生產關係。問題也因此出現。
如果Trainer每秒能夠消費100個樣本,而Generator只能生成60個,訓練算力就會閒置;反之則會造成Rollout堆積、數據陳舊,形成Policy Staleness。因此,RL基礎設施優化的核心不再是單點GPU利用率,而是Trainer Throughput與Effective Generator Throughput的動態匹配。依託這套機制,訓練與推理首次形成真正意義上的連續生產關係。RL系統越來越像一個分佈式生產系統:Generator是生產者,Trainer是消費者,整個RL系統本質上成為一個需要持續平衡吞吐、數據新鮮度與資源利用率的分佈式生產系統。
九章智算雲與中國人民大學STILL項目團隊聯合發佈的《An Empirical Study on Eliciting and Improving R1-like Reasoning Models》驗證了這一機制,研究顯示,Qwen2.5-32B、DeepSeek-R1-Distill-Qwen-1.5B等模型均可通過持續RL迭代釋放潛在推理能力,後者在AIME 2024上的準確率達到39.33%。
研究同時表明,On-policy學習是持續提升性能的重要機制,而單純獎勵更長回答容易產生“length hacking”;通過動態更新Reward Model的Cooper方法,可以緩解Reward Hacking,改善端到端RL效果。這說明RL絕非簡單的增量訓練,而是策略、生成、環境、訓練和反饋高度耦合的系統工程。其中最容易被忽視的,是Generator與Trainer之間的動態匹配。Generator過慢,訓練GPU等待;Generator過快,Rollout堆積並逐漸陳舊。
對於長時序Agent任務,一次Rollout還包含多輪工具調用和超長上下文,使Generator本身已經成為完整的實時推理系統。更進一步,兩者共享的不只是GPU,還包括模型權重、Rollout、KV Cache、Environment狀態和任務隊列。權重更新過慢會導致Policy Staleness,更新過於頻繁又會增加模型加載與數據搬運成本。所以,RL基礎設施真正要解決的並非單獨提高訓練吞吐或推理吞吐,而是讓Generator與Trainer在整個生命週期內保持高效匹配。
九章智算雲正是圍繞這一問題構建RL工程化基礎設施:將Generator、Environment和Trainer納入統一工作流,通過全局動態調度適應不同階段的資源需求——生成環節成為瓶頸時增加推理資源,訓練進入高峰時重新分配算力,Environment等待時釋放閒置GPU。由此,AI調度對象從“哪臺機器有空閒GPU”升級為“模型、軌跡、狀態和下一步計算應該在哪裡”。這麼做的好處是直接提升模型速度,在 MiniMax M2.1 229B 和 Qwen3-Coder-Next 80B 等前沿模型上,首日速度提升 1.5 倍;隨著流量變化,速度比靜態預測器再提升1.25 倍。
與此同時,大多數部署方案都是離線訓練投機者並將其凍結,導致部署速度慢,且會隨著流量和目標模型的變化而失效。九章智算雲將在線投機者學習重新定義為在生產環境中運行的異步強化學習問題:接受和拒絕的令牌作為獎勵信號,訓練服務器持續更新投機者,並且新的權重可以熱插拔到服務器,實現零停機時間。這意味著,AI雲正走向AI全工作流調度的自適應推測訓練。狀態資源化:訓推一致是衡量AI Infra的核心之一計算之外,運行狀態本身也是基礎設施的核心資源。Agent交互產生的上下文與KV Cache、RL生成的軌跡數據與獎勵信號、實時更新的模型權重,共同構成AI持續進化的狀態資產。
若這些資源被綁定在單一GPU或節點,跨節點搬運、重複Prefill和計算就會成為新的系統瓶頸。傳統數據路徑通常需要經過存儲、CPU內存、框架Buffer和GPU顯存,多次複製和轉發。在RL持續循環中,這些非計算開銷會層層累積、持續放大。針對這一行業痛點,九章智算雲依託DingoFS分佈式文件底座、DFKV分佈式緩存、全域零拷貝鏈路、RDMA高速網絡等底層技術,重新組織數據與狀態流轉。零拷貝縮短數據傳輸路徑、減少CPU參與,降低RL閉環中的非計算開銷;DFKV則將KV Cache從單GPU臨時緩存升級為可定位、可遷移、可跨任務複用的狀態資源,讓已經產生的上下文繼續創造價值。
由此,AI調度邏輯也從“哪裡有空閒GPU”,升級為“模型、算力、上下文和狀態應該在哪裡組合”。如果Agent已在某節點完成大量Prefill,後續請求即可複用已有KV Cache,避免重複計算;訓練與推理間的模型權重交換,也可依託高速數據路徑降低傳輸成本。基於此,九章智算雲真正的訓推一致的核心思路:不是簡單共享訓練與推理算力,而是讓兩者共享一套能夠同時感知計算、數據、狀態和工作流的統一基礎設施。在RL體系中,Generator本身就是訓練閉環的一部分;在Agent運行場景中,上下文與KV Cache又是任務持續運行的核心狀態,二者天然深度耦合。
這意味著,推理效率正在直接前置為訓練效率:每一次高效Token生成、每一次KV Cache複用、每一次精準調度,都可能轉化為模型迭代效率的提升。SemiAnalysis RL系統專項分析指出,只有實現訓推吞吐與系統狀態高度匹配的基礎設施,才能充分釋放RL的性能潛力,支撐模型獲得更優能力。而九章智算雲則因專注於這一點,在中國市場率先完成了大規模、全場景的工程驗證。AI雲也由“算力供應商”成為連接訓練、推理、狀態與模型迭代的核心底座。
從RL到推理優化,競爭的是“有效Token”“訓推一致”的系統能力成為RL的基礎,這樣的做法帶來顯著好處:加速推理優化技術進入生產級別,反過來影響訓練效率,促成Token成本的直線下降。這其中與MoE架構、推理優化、模型量化、模型架構和硬件協同設計等技術融合尤為關鍵。如Prefill與Decode具有不同的計算特徵,PD分離可以將兩類負載匹配到更合適的資源池;Chunked Prefill通過拆解超長上下文,緩解不同階段的資源競爭;Speculative Decoding則由小模型生成候選Token、大模型批量驗證,降低逐Token串行計算帶來的開銷。
這些技術看似獨立,本質在解決同一個問題:讓有限GPU生產更多有效Token。在九章智算雲體系中變為一條生產線——Generator產生的Token不是最終答案,而是下一輪訓練的原材料。Generator效率越高,同等算力就能生成更多Rollout;KV Cache複用減少重複Prefill;PD分離與動態調度則進一步提升計算與帶寬匹配效率。由此,訓練與推理優化最終統一為AI基礎設施生產級目標:單位算力的有效Token產出率,以及Token向模型智能的轉化效率。
這也是九章智算雲RL技術路線核心價值:並非單獨搭建RL訓練平臺,而是將Generator、Trainer、Environment、模型權重、KV Cache與GPU算力整合進統一AI Runtime。模型廠商持續提高RL訓練強度,基礎設施同步優化Rollout生成、狀態複用和資源調度,兩者共同決定後訓練Scaling能夠走多遠。這一能力也將從大模型延伸至具身智能。Agent的工具調用、多輪決策,以及機器人的感知、推理、行動與反饋,本質都是動態試錯和持續學習的RL閉環。
未來,迭代環境將從代碼沙箱、工具調用場景,延伸至模擬器、真實機器人與物理世界,但基礎設施需求依然一致:彈性算力、實時推理、狀態管理、高頻反饋和持續迭代。隨著行業從大規模訓練轉向後訓練強化學習,RL正在從單一模型訓練算法,成為連接大模型、Agent與具身智能的通用技術底座。RL讓模型能力持續Scaling,九章智算雲則讓這種Scaling能夠高效、規模化地發生。這正是強化學習從算法走向AI雲原生基礎設施核心技術棧的關鍵所在。
Related
相關文章

王興興“錯配”梁文鋒?
王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。