智譜提出異步強化學習新方案SAO
重點摘要
強化學習(Reinforcement Learning, RL)正逐漸成為大型語言模型(LLM)後訓練階段的關鍵技術。然而,過往針對LLM設計的強化學習流程多半採用同步或批次交錯的處理方式,這在需要長時間跨度推理與互動的智能體(Agentic)任務中顯得效率不彰。近期雖然出現了非同步強化學習(Asynchronous RL)作為替代方案,能透過邊收集軌跡邊更新模型的方式提升吞吐量,但在訓練穩定性與任務有效性上仍存在諸多未解難題。
強化學習(Reinforcement Learning, RL)正逐漸成為大型語言模型(LLM)後訓練階段的關鍵技術。然而,過往針對LLM設計的強化學習流程多半採用同步或批次交錯的處理方式,這在需要長時間跨度推理與互動的智能體(Agentic)任務中顯得效率不彰。近期雖然出現了非同步強化學習(Asynchronous RL)作為替代方案,能透過邊收集軌跡邊更新模型的方式提升吞吐量,但在訓練穩定性與任務有效性上仍存在諸多未解難題。
為此,智譜研究團隊提出了一套名為「單軌跡非同步優化」(Single-Rollout Asynchronous Optimization,SAO)的新架構,旨在解決非同步訓練中的穩定性與離策略(Off-Policy)挑戰。該篇論文於2026年7月8日提交至arXiv預印本平台,由智譜團隊的侯振宇、李玉江、唐傑與董雨曉共同撰寫。研究團隊觀察到,當前廣泛使用的GRPO(Group Relative Policy Optimization)框架採用了「群體抽樣」(Group-Wise Sampling)機制,亦即同一個提示(Prompt)會生成多條軌跡進行比較優化。
然而,這種設計在非同步訓練的情境下並不容易完美對接,容易導致訓練過程不穩定以及策略更新與實際數據分布脫節的問題。SAO的核心突破在於將抽樣策略從「群體」轉向「單一」。具體來說,SAO捨棄了為每個提示收集多組回應的方式,改為每組提示僅進行一次軌跡展開(One Rollout per Prompt)。這種單軌跡採樣的設計,有效減少了非同步訓練中因數據延遲而導致的離策略效應,進而提升模型在面臨新數據時的泛化能力。為了讓這種單軌跡策略能充分發揮作用,團隊還引入了實用的價值模型(Value Model)訓練設計,讓模型在僅有一條軌跡的情況下依然能穩健學習。
在優化穩定性方面,SAO導入了一項嚴格的「雙側詞元層級裁剪策略」(Double-Side Token-Level Clipping)。過往的裁切機制多半僅針對單邊進行限制,而SAO的做法是從上下兩個方向對每個詞元(Token)的更新幅度進行約束,確保模型參數在每次迭代中都不會產生劇烈震盪。這項設計讓SAO能夠在不發生訓練崩潰的前提下,穩定地執行超過一千步的更新,這在以長序列任務為主的智能體訓練中是一項重要的保障。為了驗證SAO的實際效能,研究團隊將其與GRPO及其多種變體架構進行了對比測試。
測試涵蓋了程式碼生成與數學推理等指標性基準,包括SWE-Bench Verified(軟體工程真實場景)、BeyondAIME以及IMOAnswerBench(國際數學奧林匹克等級推理)。實驗結果顯示,SAO在這些高難度的智能體任務上,持續且顯著地超越了GRPO的表現,證明其在複雜推理與工具使用場景下的優勢。值得一提的是,SAO在模擬在線學習(Simulated Online Learning)的場景中展現了極強的適應能力。在這種設定下,模型面對的環境與任務會隨時間動態變化,傳統的批次訓練方法往往難以快速應對。
SAO憑藉其單軌跡即時更新的特性,能夠更靈敏地捕捉環境變動的訊號,持續調整策略以保持高效表現。這對於必須在真實動態環境中運作的AI系統而言,具有重要的實戰意義。根據論文披露,這項SAO方案已經被成功部署於智譜開源GLM-5.2模型(750B-A40B參數規模)的智能體強化學習訓練流程中。這證明SAO並非僅停留在理論階段,而是能夠支撐起數百億參數等級大規模模型的實際訓練需求,為後續更強大的基座模型提供了可行的技術路徑。整體而言,SAO透過將抽樣模式簡化、強化穩定性約束,有效填補了非同步強化學習在智能體訓練領域的關鍵空白。
這項研究不僅解決了GRPO等現有框架在非同步環境下的適配難題,更為AI模型從靜態問答邁向動態環境中的自主任務執行,提供了兼具效率與穩定度的訓練新典範。隨著GLM-5.2等模型持續演化,SAO所奠定的技術路線將可能在未來的AI自主決策與工具操作上扮演更為核心的角色。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。