IT之家模型更新

華為昇騰宣佈已支持 RL 訓推一致性,實測獲得最高 60% 性能收益

2026年8月6日 16:13
華為昇騰宣佈已支持 RL 訓推一致性,實測獲得最高 60% 性能收益

重點摘要

首頁 > 智能時代>人工智能 華為昇騰宣佈已支持 RL 訓推一致性,實測獲得最高 60% 性能收益 2026/8/6 16:13:17 來源:IT之家 作者:汪淼 責編:汪淼 評論: 感謝IT之家網友 不一樣的體驗 的線索投遞! IT之家 8 月 6 日消息,強化學習已成為大模型訓練主流範式,推動模型技術向行業核心場景工程化落地。其中,訓推一致至關重要,因推理與訓練過程耦合,基礎設施差異易放大不確定性。

站內 AI 整理稿

強化學習已成為當前大規模語言模型訓練的主流範式,推動模型技術從實驗室走向行業核心場景的工程化落地。在這一過程中,訓練與推理之間的一致性扮演著關鍵角色,因為推理與訓練在計算流程上高度耦合,基礎設施的細微差異容易被放大,導致數值不確定性。為解決此問題,華為計算官方於8月5日正式宣布,昇騰AI計算平台已基於Ascend C編程語言提供完整的訓推一致算子集,並在實際測試中驗證了顯著成效。 所謂訓推一致性,指的是Rollout(推理)引擎與訓練引擎之間在數值計算上的完全一致。在強化學習的後訓練階段,模型通常需要先進行推理(rollout)產生樣本,再將這些樣本用於訓練更新。如果推理與訓練的計算過程存在數值差異,就會導致策略偏移,無法達到真正的「true-on-policy」效果。這種不一致性最根本的原因,在於底層計算時累加不保序——不同硬體架構或軟體框架對浮點數加法順序的處理方式不同,即便同樣的數學運算,也可能產生微小誤差,進而影響模型收斂與最終效能。 更棘手的是,模型參數規模越大,這個問題就會被進一步放大。當模型採用張量並行、專家並行等切分策略時,多個計算節點之間的數據分配與集合通信路徑都會影響累加順序。任一環節的對齊失誤,都無法保證最終的數值一致性。因此,要從上到下保證訓練引擎與推理引擎每一次累加順序完全一致,必須同時在框架側與算子側進行系統性協同優化。算子還需要覆蓋多種調用場景,在關鍵計算步驟上施加約束,同時把性能損失控制在可用範圍之內——這是一項極具挑戰的系統工程。 華為昇騰團隊選擇以Ascend C編程語言為核心,建構完整的訓推一致算子集。Ascend C是華為針對昇騰硬體架構設計的領域專用語言,能夠讓開發者更靈活地定義高效算子,同時確保計算精度與順序的可控性。透過這套算子集,昇騰平台在Qwen3-30B MoE(混合專家)模型上進行了嚴格的數值一致性測試,結果顯示Logdiff(對數差異)成功達到0,代表訓練與推理在數值層面完全一致。 除了達成數值一致性,華為還進一步尋求性能提升。研究團隊導入昇騰親和的FA(Flash Attention)算子優化,針對注意力機制進行加速。在Eager執行模式(即動態圖模式,常用於研究與調試)下,這項優化為開發者帶來了20%至60%的性能收益,意即在不犧牲一致性的前提下,大幅縮短訓練與推理所需時間,提高強化學習整體迭代效率。 這項成果對於大模型開發者而言具有實質意義。在強化學習後訓練的典型流程中,開發者需要反覆切換推理與訓練引擎,若兩者數值不一致,輕則造成模型效能波動,重則導致訓練失敗。如今昇騰平台提供完整的訓推一致算子集,搭配高效FA算子,不僅讓開發者可以放心使用同一套算子進行推理與訓練,還能直接獲得顯著的加速效果,降低調試成本與時間。 值得留意的是,強化學習的正向收益高度依賴於策略的準確性。如果推理與訓練的數值不一致,即使模型參數更新方向正確,也可能因為累積誤差而偏離預期。華為的這項技術突破,從根本上解決了累加不保序的痛點,並且在實際應用場景中驗證了其可行性。Qwen3-30B MoE模型作為阿里雲推出的先進混合專家模型,參數規模適中,結構複雜,正好能反映真實生產環境中的挑戰。 從更宏觀的角度看,訓推一致性不僅是技術細節,更是產業化落地的關鍵門檻。隨著大模型朝更大規模、更複雜架構演進,基礎設施的穩定性與可重複性愈發重要。華為昇騰此次宣布的支援方案,為國內外開發者提供了一條經過實測驗證的技術路徑,可能加速強化學習在金融、製造、醫療等行業核心場景的應用。 目前,該方案已對外開放,開發者可以透過昇騰官方文檔與開發工具獲取相關算子集與優化指南。華為計算方面表示,將持續投入資源,不斷完善昇騰生態在強化學習領域的工具鏈,讓更多團隊能夠快速、可靠地部署大模型訓練與推理工作。隨著訓推一致性的問題逐步獲得系統性解決,未來大模型從研究到落地的週期有望進一步縮短,為人工智慧產業帶來更穩健的成長動能。

Related

相關文章

DeepSeek也扛不住了?API降價後又將大幅漲價

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
鈦媒體模型更新

Qwen3.8,是千問辦公的“塞爾達”嗎?

阿里旗下通義千問在辦公場景的最新佈局,或許不只是為了賣更多的 API token。近日推出的 Qwen3.8,被內部視為「千問辦公的塞爾達」,這個比喻暗示著它不僅是一個獨立的 AI 模型,更可能承載著開放、可探索、高自由度的產品生態野心。不同於傳統模型單純依賴 token 計費的模式,Qwen3.

剛剛
鈦媒體模型更新

耗時41分鐘,千問辦公押注了怎樣的Agent未來?

千問辦公在生成具身智能行業週報的測試中耗時41分鐘,速度雖慢但強調深度判斷與信源核實,與其他追求效率的AI辦公產品形成對比。文章探討了Token作為AI時代商業語言,以及企業可能推動Agent走向更「重」的未來,以建立用戶信任。三款產品代表不同路線,千問辦公選擇了更注重判斷過程的路徑。

剛剛
鈦媒體模型更新

辦公智能體平臺“Work”大作戰

騰訊WorkBuddy崛起帶動辦公智能體平台賽道競爭加劇,阿里、字節等大廠加速整合旗下產品迎戰,市場規模快速成長。各大廠商在商業化模式上持續摸索,飛書、滴普等業者表現不一,未來競爭將更為激烈。

剛剛