以GLM-5為例,探究九章智算雲強化學習系統如何落地“訓推一致”

2026年8月19日 07:55
站內 AI 整理稿

過去幾年,大模型競爭的主線很清晰:更大的模型、更多的數據和更強的GPU集群。但隨著預訓練邊際收益遞減,模型能力Scaling正從單純的預訓練堆疊向後訓練強化學習(RL)轉變,數學推理、代碼生成、複雜決策、長時序Agent等高階能力,越來越依賴後訓練強化學習(RL)激發。RL通過生成、執行、反饋和獎勵,讓模型持續學習推理、規劃與自我糾錯的能力。由此,大模型發展從“一次性訓練”進入“持續訓練”,模型能力Scaling也從預訓練延伸至生成、反饋和迭代全過程。

SemiAnalysis指出,當RL成為模型能力持續Scaling的關鍵,競爭的就不只是算法,還有支撐模型持續生成、訓練和更新的AI基礎設施系統。問題也隨之變成:當模型越依賴RL獲得能力,誰來支撐這種能力持續低成本地生產。從“模型+算力”到算法與AI基礎設施共同Scaling智譜近期的模型迭代,為觀察後訓練RL提供了一個窗口。智譜公告指出,GLM-5.3與GLM-5.2在相同基座上推進強化學習,通過後訓練Scaling持續提升模型智能上界。以GLM-5.2為例,其在SWE-bench Pro取得62.1分、Terminal-Bench 3.0達到81.

0分,核心驅動力正是面向長時序、多步驟、工具聯動場景的RL訓練。這意味著,複雜推理和Agent能力的提升,正越來越依賴強化學習。這一變化也正在影響AI產業鏈分工方式:模型廠商不再只是單獨推進算法,而是需要與AI基礎設施共同服務於“智能持續生產”。目前,GLM-5系列、DeepSeek R系列等主流推理模型均已部署於九章智算雲,實現規模化Token生產。不同於“模型+算力”的傳統產業關係,九章智算雲與模型廠商雙方形成了算法與工程系統雙向RL Scaling的協作模式:模型廠商持續挑戰RL算法和策略邊界,九章智算雲則持續打磨適配的算力調度、推理服務和狀態管理,實現工業級應用。

大規模應用的模型算法再進化,進而提出更高的基礎設施要求,而基礎設施的持續迭代又為更大規模RL實現打開空間。由此,模型廠商與AI基礎設施成為RL的一體兩面,RL從模型訓練中的單一算法環節,升級為AI雲必須具備的核心能力。模型、算力、數據、狀態和推理不再彼此割裂,而是共同構成一條持續運行的智能生產線。真正的問題也由“模型+算力”轉向如何讓算法與基礎設施協同Scaling,以“一條智能生產線”更低成本持續生產有效Token和模型能力。RL讓訓練與推理成為一條生產線強化學習與傳統預訓練的核心差異,不在於增加一種訓練算法,而在於改變了訓練系統的結構。

一個完整的RL系統通常由三部分組成:Generator、Environment和Trainer。Generator接收Prompt並通過推理生成Rollout;Environment執行代碼、工具調用或任務模擬並返回Reward;Trainer依據Rollout和Reward更新模型權重,再將新權重回傳Generator,形成Generate→Reward→Train→Update→Generate的持續閉環。與預訓練依賴固定數據集不同,RL的訓練數據由模型實時生成,因此訓練與推理第一次真正形成了連續生產關係。問題也因此出現。

如果Trainer每秒能夠消費100個樣本,而Generator只能生成60個,訓練算力就會閒置;反之則會造成Rollout堆積、數據陳舊,形成Policy Staleness。因此,RL基礎設施優化的核心不再是單點GPU利用率,而是Trainer Throughput與Effective Generator Throughput的動態匹配。依託這套機制,訓練與推理首次形成真正意義上的連續生產關係。RL系統越來越像一個分佈式生產系統:Generator是生產者,Trainer是消費者,整個RL系統本質上成為一個需要持續平衡吞吐、數據新鮮度與資源利用率的分佈式生產系統。

九章智算雲與中國人民大學STILL項目團隊聯合發佈的《An Empirical Study on Eliciting and Improving R1-like Reasoning Models》驗證了這一機制,研究顯示,Qwen2.5-32B、DeepSeek-R1-Distill-Qwen-1.5B等模型均可通過持續RL迭代釋放潛在推理能力,後者在AIME 2024上的準確率達到39.33%。

研究同時表明,On-policy學習是持續提升性能的重要機制,而單純獎勵更長回答容易產生“length hacking”;通過動態更新Reward Model的Cooper方法,可以緩解Reward Hacking,改善端到端RL效果。這說明RL絕非簡單的增量訓練,而是策略、生成、環境、訓練和反饋高度耦合的系統工程。其中最容易被忽視的,是Generator與Trainer之間的動態匹配。Generator過慢,訓練GPU等待;Generator過快,Rollout堆積並逐漸陳舊。

對於長時序Agent任務,一次Rollout還包含多輪工具調用和超長上下文,使Generator本身已經成為完整的實時推理系統。更進一步,兩者共享的不只是GPU,還包括模型權重、Rollout、KV Cache、Environment狀態和任務隊列。權重更新過慢會導致Policy Staleness,更新過於頻繁又會增加模型加載與數據搬運成本。所以,RL基礎設施真正要解決的並非單獨提高訓練吞吐或推理吞吐,而是讓Generator與Trainer在整個生命週期內保持高效匹配。

九章智算雲正是圍繞這一問題構建RL工程化基礎設施:將Generator、Environment和Trainer納入統一工作流,通過全局動態調度適應不同階段的資源需求——生成環節成為瓶頸時增加推理資源,訓練進入高峰時重新分配算力,Environment等待時釋放閒置GPU。由此,AI調度對象從“哪臺機器有空閒GPU”升級為“模型、軌跡、狀態和下一步計算應該在哪裡”。這麼做的好處是直接提升模型速度,在 MiniMax M2.1 229B 和 Qwen3-Coder-Next 80B 等前沿模型上,首日速度提升 1.5 倍;隨著流量變化,速度比靜態預測器再提升1.25 倍。

與此同時,大多數部署方案都是離線訓練投機者並將其凍結,導致部署速度慢,且會隨著流量和目標模型的變化而失效。九章智算雲將在線投機者學習重新定義為在生產環境中運行的異步強化學習問題:接受和拒絕的令牌作為獎勵信號,訓練服務器持續更新投機者,並且新的權重可以熱插拔到服務器,實現零停機時間。這意味著,AI雲正走向AI全工作流調度的自適應推測訓練。狀態資源化:訓推一致是衡量AI Infra的核心之一計算之外,運行狀態本身也是基礎設施的核心資源。Agent交互產生的上下文與KV Cache、RL生成的軌跡數據與獎勵信號、實時更新的模型權重,共同構成AI持續進化的狀態資產。

若這些資源被綁定在單一GPU或節點,跨節點搬運、重複Prefill和計算就會成為新的系統瓶頸。傳統數據路徑通常需要經過存儲、CPU內存、框架Buffer和GPU顯存,多次複製和轉發。在RL持續循環中,這些非計算開銷會層層累積、持續放大。針對這一行業痛點,九章智算雲依託DingoFS分佈式文件底座、DFKV分佈式緩存、全域零拷貝鏈路、RDMA高速網絡等底層技術,重新組織數據與狀態流轉。零拷貝縮短數據傳輸路徑、減少CPU參與,降低RL閉環中的非計算開銷;DFKV則將KV Cache從單GPU臨時緩存升級為可定位、可遷移、可跨任務複用的狀態資源,讓已經產生的上下文繼續創造價值。

由此,AI調度邏輯也從“哪裡有空閒GPU”,升級為“模型、算力、上下文和狀態應該在哪裡組合”。如果Agent已在某節點完成大量Prefill,後續請求即可複用已有KV Cache,避免重複計算;訓練與推理間的模型權重交換,也可依託高速數據路徑降低傳輸成本。基於此,九章智算雲真正的訓推一致的核心思路:不是簡單共享訓練與推理算力,而是讓兩者共享一套能夠同時感知計算、數據、狀態和工作流的統一基礎設施。在RL體系中,Generator本身就是訓練閉環的一部分;在Agent運行場景中,上下文與KV Cache又是任務持續運行的核心狀態,二者天然深度耦合。

這意味著,推理效率正在直接前置為訓練效率:每一次高效Token生成、每一次KV Cache複用、每一次精準調度,都可能轉化為模型迭代效率的提升。SemiAnalysis RL系統專項分析指出,只有實現訓推吞吐與系統狀態高度匹配的基礎設施,才能充分釋放RL的性能潛力,支撐模型獲得更優能力。而九章智算雲則因專注於這一點,在中國市場率先完成了大規模、全場景的工程驗證。AI雲也由“算力供應商”成為連接訓練、推理、狀態與模型迭代的核心底座。

從RL到推理優化,競爭的是“有效Token”“訓推一致”的系統能力成為RL的基礎,這樣的做法帶來顯著好處:加速推理優化技術進入生產級別,反過來影響訓練效率,促成Token成本的直線下降。這其中與MoE架構、推理優化、模型量化、模型架構和硬件協同設計等技術融合尤為關鍵。如Prefill與Decode具有不同的計算特徵,PD分離可以將兩類負載匹配到更合適的資源池;Chunked Prefill通過拆解超長上下文,緩解不同階段的資源競爭;Speculative Decoding則由小模型生成候選Token、大模型批量驗證,降低逐Token串行計算帶來的開銷。

這些技術看似獨立,本質在解決同一個問題:讓有限GPU生產更多有效Token。在九章智算雲體系中變為一條生產線——Generator產生的Token不是最終答案,而是下一輪訓練的原材料。Generator效率越高,同等算力就能生成更多Rollout;KV Cache複用減少重複Prefill;PD分離與動態調度則進一步提升計算與帶寬匹配效率。由此,訓練與推理優化最終統一為AI基礎設施生產級目標:單位算力的有效Token產出率,以及Token向模型智能的轉化效率。

這也是九章智算雲RL技術路線核心價值:並非單獨搭建RL訓練平臺,而是將Generator、Trainer、Environment、模型權重、KV Cache與GPU算力整合進統一AI Runtime。模型廠商持續提高RL訓練強度,基礎設施同步優化Rollout生成、狀態複用和資源調度,兩者共同決定後訓練Scaling能夠走多遠。這一能力也將從大模型延伸至具身智能。Agent的工具調用、多輪決策,以及機器人的感知、推理、行動與反饋,本質都是動態試錯和持續學習的RL閉環。

未來,迭代環境將從代碼沙箱、工具調用場景,延伸至模擬器、真實機器人與物理世界,但基礎設施需求依然一致:彈性算力、實時推理、狀態管理、高頻反饋和持續迭代。隨著行業從大規模訓練轉向後訓練強化學習,RL正在從單一模型訓練算法,成為連接大模型、Agent與具身智能的通用技術底座。RL讓模型能力持續Scaling,九章智算雲則讓這種Scaling能夠高效、規模化地發生。這正是強化學習從算法走向AI雲原生基礎設施核心技術棧的關鍵所在。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛
全天候科技生成式AI

企業AI最後一公里:三路人馬在此交鋒

鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。

剛剛