5050億參數!餘承東開源盤古新模型,“世界第一”還有些距離
重點摘要
華為開源基於昇騰NPU訓練的盤古MoE模型openPangu-2.0-Pro,總參數規模5050億、激活參數180億,支援512K上下文長度,訓練數據約34T tokens。這是餘承東喊話「把盤古做到世界第一」後的首個重磅開源,但技術報告顯示其處理複雜軟體工程任務仍與頂尖模型有明顯差距,且未公開與第三方模型的對比結果。該系列主打長上下文智慧體任務,並搭配昇騰原生推理框架與軟硬體協同設計來提升效率。
華為今日正式開源基於昇騰NPU訓練的盤古MoE模型openPangu-2.0-Pro,這是該系列最新一代開源模型,總參數規模達5050億,激活參數規模為180億,支援512K上下文長度,訓練數據總量約34T tokens。與此同時,輕量化模型openPangu-2.0-Flash已於6月12日開源,參數為92億,其中6億為激活參數。回顧今年6月12日,在華為開發者大會現場,華為常務董事、產品投資評審委員會主任、終端BG董事長余承東正式發布openPangu-2.0-Flash,並預告openPangu-2.0-Pro的到來,當時他公開喊話要將盤古大模型做到世界第一。此次openPangu-2.
0-Pro的開源,正是余承東放話之後華為在盤古大模型領域的首次重磅動作。從技術報告內容來看,華為僅披露了openPangu-2.0兩款模型的相關數據,並未附上與第三方模型的對照結果。報告中指出,openPangu-2.0系列模型在通用能力、邏輯推理、智能體相關的主流評測基準中均具備出色的對標實力。不過,報告也坦承,在處理複雜現實世界軟件工程任務時,該系列模型仍與頂尖模型存在明顯差距。在模型架構方面,openPangu-2.0-Pro實現了全面升級。
Attention架構沿用高效MLA,並採用DSA與SWA獨立分層混合架構,層配比為1比2;其中SWA層負責局部窗口建模,DSA層負責稀疏全局聚合,在維持精度的同時顯著降低長序列推理過程中的計算、顯存與訪存開銷。拓撲架構方面,傳統殘差連接升級為4支流mHC架構,有助於提升表徵多樣性與泛化能力。自投機模塊則採用3頭MTP架構,一次額外預測3個token,提升模型推理速度。訓練過程中使用Muon優化器,可獲得更快的收斂速度。
此外,這項研究還發現一套正向協同反饋機制:底層性能強勁的基礎推理能力可以直接支撐複雜智能體行為的運行,而智能體的持續運行又會反向迭代優化模型的多階任務規劃能力與長軌跡上下文處理水平。目前,openPangu-2.0-Pro模型的模型權重、基礎推理代碼及技術報告已正式開源上線。從應用定位來看,智能體應用要求模型能夠執行長程任務、精準調用外部工具,並在長時間運行時保持認知一致性。然而,模型在實際部署過程中往往會暴露出不少問題,例如現有通用框架會帶來不必要的推理資源損耗,拉長上下文長度會拖累模型表現;傳統對齊手段穩定性不足,在運行長週期任務時常出現時間邏輯、層級結構方面的推理問題。
為了解決這些痛點,openPangu-2.0系列模型融合了自研硬件內核、整機系統架構、訓推一體化智能體強化學習算法,搭配專屬推理加速方案,搭建了一套完備的軟硬件協同設計體系,是專門針對長上下文智能體任務所打造。余承東在發布openPangu-2.0-Flash時曾提到,從算法架構到訓練推理,此次盤古模型重點針對昇騰算力進行了優化,並且更深度地開源。昇騰原生訓練的訓練效率提升了30%,且這是業界首個採用DSA加SWA獨立分層混合架構的模型。他也特別強調,這是首個開源預訓練代碼、後訓練代碼、訓推算子的模型。根據Hugging Face的數據,本地離線模型openPangu-2.
0-Flash GGUF上月下載量達到39935次。華為還推出了一種專為資源有限環境優化設計的30億參數模型,其中2億為激活參數。研究人員基於多個公開基準測試評估了openPangu-2.0模型的性能。在通用能力方面,openPangu-2.0-Flash和openPangu-2.0-Pro在多種通用測試中都表現優異,涵蓋上下文學習、指令遵循以及多輪理解能力等面向。在世界知識及事實可靠性測試中,openPangu-2.0-Pro的表現遠超過openPangu-2.0-Flash。
華為內部實驗中,研究人員發現,為模型建立扎實的基礎知識及推理能力有助於學習更複雜的智能體行為和編程技能;反過來,在複雜的智能體環境中進行訓練也能明顯提升模型的基本能力,包括指令遵循、長軌跡上下文處理、多步推理以及程序規劃等。此外,在訓練過程中及訓練結束後,持續提供高質量、多樣化的長軌跡智能體數據以及互動環境具有明顯優勢,這也成為未來模型升級的核心策略之一。從核心架構來看,openPangu-2.0系列模型採用分層混合注意力機制來完成上下文計算解耦:將滑動窗口注意力機制用於稠密局部上下文的處理,將深度稀疏注意力機制用於全局稀疏信息檢索。
為了實現推理加速,模型額外搭載了一個三頭多Token預測模塊,並將流形約束超連接與Muon優化器相結合,在固定數據投入量的前提下提升模型收斂速度。研究人員還針對MoE負載均衡、mHC結構穩定性、MTP訓練策略以及Muon參數分組分別設計專屬優化方案,以保障端到端訓練全過程的穩定性。訓練基礎設施方面,當模型拓展至512K上下文窗口,同時疊加mHC、Muon、MTP等多重複雜基礎架構單元,會帶來更高的通信開銷與顯存佔用瓶頸。
為此,研發人員搭建了一套系統化的協同優化框架,融合無冗餘混合上下文並行、面向MTP的輕量化點對點數據傳輸、適配Muon優化器的分佈式計算通信重疊機制以及混合重計算策略;並依託Ascend C專用編程語言定製融合內核,對mHC、參數化注意力匯點、模塊化注意力等模塊進行深度加速。為釋放CloudMatrix 384超節點集群的整體算力,華為也落地了一套精簡且感知網絡拓撲的硬件親和調度策略,將高帶寬數據流約束在超節點內部交互,最大限度減少跨節點數據傳輸開銷,實現硬件資源利用率最大化。預訓練階段,openPangu-2.0的預訓練語料庫包含約34T tokens。
為了優化學習過程,預訓練過程被劃分為三個階段,每個階段都採用特定的數據配方和選擇策略來逐步提升模型能力。第一階段是通用領域,使用25T tokens,重點在於建立扎實的通用知識和廣泛的語言能力基礎。第二階段是推理能力培養,使用8T tokens,著重提升深度推理能力、邏輯思維能力以及高級編程技能。第三階段是退火處理,使用1.4T tokens,目的是優化模型行為和智能體能力,研究人員在此階段特意保留較長的文檔和複雜的軌跡數據,以最大限度提升模型的自主任務處理能力。其預訓練語料庫彙集了網頁、書籍、PDF文件、多語言文本、代碼庫等數據。
後訓練階段則分為三級流水線,包括監督微調、並行強化學習專家訓練、多專家在線策略蒸餾。完成統一監督微調後,系統並行訓練多組強化學習專家模型;各組專家依託獨立數據集與專屬獎勵函數,分別針對邏輯推理、通用問答、智能體交互、代碼生成四大領域優化策略,消除強化學習過程中的跨領域任務干擾。最後藉助在線策略蒸餾完成各路專家能力的融合聚合。推理加速方面,華為自研了昇騰原生推理框架,實現硬件執行邏輯與模型運行時動態行為耦合。該架構自研多款融合算子,包含面向推理場景優化的mHC算子、專用集合通信原語,同時配套Felix上下文並行、單核多流執行等並行策略。
為提升推理吞吐,該框架搭配了定製量化方案與算子感知式保精度量化機制,並集成混合KV緩存管理、無損並行分詞,基於模塊化注意力原生適配自動前綴緩存與MTP技術。在128K上下文長度下,這套框架在昇騰NPU硬件的長上下文推理性能表現為:openPangu-2.0-Flash版本最低TPOT時延可達5.63ms,在TPOT為15ms的工況下單卡NPU生成吞吐1846 token/s;openPangu-2.0-Pro版本最低TPOT時延9.55ms,TPOT 20ms條件下單卡吞吐1326 token/s。整體而言,基於昇騰平台的硬件與軟件協同設計方法,openPangu-2.
0模型解決了大模型訓練、長上下文對齊以及推理效率方面的關鍵瓶頸。華為在技術報告中明確表示,他們的目標不僅僅停留在靜態基準測試的性能上,而是更注重實際系統的實用性。openPangu在戰略上處於有利地位,有望成為智能設備、汽車等領域智能體應用的核心競爭力。與此同時,華為也在積極擴展基於邊緣計算的能力,利用麒麟處理器架構來突破設備智能化的極限。為了實現這一變革,華為將以昇騰硬件生態系統為基礎,進一步擴展基於沙盒的仿真流程,以在複雜且開放性的場景中生成大量高保真度的執行數據集。未來幾個月,研究人員將持續迭代該模型,目標是在編程和複雜智能體任務方面,系統性地提升openPangu的核心能力。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。