IT之家模型更新

華為昇騰宣佈已支持 RL 訓推一致性,實測獲得最高 60% 性能收益

2026年8月6日 16:13
華為昇騰宣佈已支持 RL 訓推一致性,實測獲得最高 60% 性能收益

重點摘要

首頁 > 智能時代>人工智能 華為昇騰宣佈已支持 RL 訓推一致性,實測獲得最高 60% 性能收益 2026/8/6 16:13:17 來源:IT之家 作者:汪淼 責編:汪淼 評論: 感謝IT之家網友 不一樣的體驗 的線索投遞! IT之家 8 月 6 日消息,強化學習已成為大模型訓練主流範式,推動模型技術向行業核心場景工程化落地。其中,訓推一致至關重要,因推理與訓練過程耦合,基礎設施差異易放大不確定性。

站內 AI 整理稿

強化學習已成為當前大規模語言模型訓練的主流範式,推動模型技術從實驗室走向行業核心場景的工程化落地。在這一過程中,訓練與推理之間的一致性扮演著關鍵角色,因為推理與訓練在計算流程上高度耦合,基礎設施的細微差異容易被放大,導致數值不確定性。為解決此問題,華為計算官方於8月5日正式宣布,昇騰AI計算平台已基於Ascend C編程語言提供完整的訓推一致算子集,並在實際測試中驗證了顯著成效。所謂訓推一致性,指的是Rollout(推理)引擎與訓練引擎之間在數值計算上的完全一致。在強化學習的後訓練階段,模型通常需要先進行推理(rollout)產生樣本,再將這些樣本用於訓練更新。

如果推理與訓練的計算過程存在數值差異,就會導致策略偏移,無法達到真正的「true-on-policy」效果。這種不一致性最根本的原因,在於底層計算時累加不保序——不同硬體架構或軟體框架對浮點數加法順序的處理方式不同,即便同樣的數學運算,也可能產生微小誤差,進而影響模型收斂與最終效能。更棘手的是,模型參數規模越大,這個問題就會被進一步放大。當模型採用張量並行、專家並行等切分策略時,多個計算節點之間的數據分配與集合通信路徑都會影響累加順序。任一環節的對齊失誤,都無法保證最終的數值一致性。因此,要從上到下保證訓練引擎與推理引擎每一次累加順序完全一致,必須同時在框架側與算子側進行系統性協同優化。

算子還需要覆蓋多種調用場景,在關鍵計算步驟上施加約束,同時把性能損失控制在可用範圍之內——這是一項極具挑戰的系統工程。華為昇騰團隊選擇以Ascend C編程語言為核心,建構完整的訓推一致算子集。Ascend C是華為針對昇騰硬體架構設計的領域專用語言,能夠讓開發者更靈活地定義高效算子,同時確保計算精度與順序的可控性。透過這套算子集,昇騰平台在Qwen3-30B MoE(混合專家)模型上進行了嚴格的數值一致性測試,結果顯示Logdiff(對數差異)成功達到0,代表訓練與推理在數值層面完全一致。除了達成數值一致性,華為還進一步尋求性能提升。

研究團隊導入昇騰親和的FA(Flash Attention)算子優化,針對注意力機制進行加速。在Eager執行模式(即動態圖模式,常用於研究與調試)下,這項優化為開發者帶來了20%至60%的性能收益,意即在不犧牲一致性的前提下,大幅縮短訓練與推理所需時間,提高強化學習整體迭代效率。這項成果對於大模型開發者而言具有實質意義。在強化學習後訓練的典型流程中,開發者需要反覆切換推理與訓練引擎,若兩者數值不一致,輕則造成模型效能波動,重則導致訓練失敗。如今昇騰平台提供完整的訓推一致算子集,搭配高效FA算子,不僅讓開發者可以放心使用同一套算子進行推理與訓練,還能直接獲得顯著的加速效果,降低調試成本與時間。

值得留意的是,強化學習的正向收益高度依賴於策略的準確性。如果推理與訓練的數值不一致,即使模型參數更新方向正確,也可能因為累積誤差而偏離預期。華為的這項技術突破,從根本上解決了累加不保序的痛點,並且在實際應用場景中驗證了其可行性。Qwen3-30B MoE模型作為阿里雲推出的先進混合專家模型,參數規模適中,結構複雜,正好能反映真實生產環境中的挑戰。從更宏觀的角度看,訓推一致性不僅是技術細節,更是產業化落地的關鍵門檻。隨著大模型朝更大規模、更複雜架構演進,基礎設施的穩定性與可重複性愈發重要。

華為昇騰此次宣布的支援方案,為國內外開發者提供了一條經過實測驗證的技術路徑,可能加速強化學習在金融、製造、醫療等行業核心場景的應用。目前,該方案已對外開放,開發者可以透過昇騰官方文檔與開發工具獲取相關算子集與優化指南。華為計算方面表示,將持續投入資源,不斷完善昇騰生態在強化學習領域的工具鏈,讓更多團隊能夠快速、可靠地部署大模型訓練與推理工作。隨著訓推一致性的問題逐步獲得系統性解決,未來大模型從研究到落地的週期有望進一步縮短,為人工智慧產業帶來更穩健的成長動能。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

2 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

2 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前