5050億參數!餘承東開源盤古新模型,“世界第一”還有些距離
重點摘要
華為開源基於昇騰NPU訓練的盤古MoE模型openPangu-2.0-Pro,總參數規模5050億、激活參數180億,支援512K上下文長度,訓練數據約34T tokens。這是餘承東喊話「把盤古做到世界第一」後的首個重磅開源,但技術報告顯示其處理複雜軟體工程任務仍與頂尖模型有明顯差距,且未公開與第三方模型的對比結果。該系列主打長上下文智慧體任務,並搭配昇騰原生推理框架與軟硬體協同設計來提升效率。
華為今日正式開源基於昇騰NPU訓練的盤古MoE模型openPangu-2.0-Pro,這是該系列最新一代開源模型,總參數規模達5050億,激活參數規模為180億,支援512K上下文長度,訓練數據總量約34T tokens。與此同時,輕量化模型openPangu-2.0-Flash已於6月12日開源,參數為92億,其中6億為激活參數。 回顧今年6月12日,在華為開發者大會現場,華為常務董事、產品投資評審委員會主任、終端BG董事長余承東正式發布openPangu-2.0-Flash,並預告openPangu-2.0-Pro的到來,當時他公開喊話要將盤古大模型做到世界第一。此次openPangu-2.0-Pro的開源,正是余承東放話之後華為在盤古大模型領域的首次重磅動作。 從技術報告內容來看,華為僅披露了openPangu-2.0兩款模型的相關數據,並未附上與第三方模型的對照結果。報告中指出,openPangu-2.0系列模型在通用能力、邏輯推理、智能體相關的主流評測基準中均具備出色的對標實力。不過,報告也坦承,在處理複雜現實世界軟件工程任務時,該系列模型仍與頂尖模型存在明顯差距。 在模型架構方面,openPangu-2.0-Pro實現了全面升級。Attention架構沿用高效MLA,並採用DSA與SWA獨立分層混合架構,層配比為1比2;其中SWA層負責局部窗口建模,DSA層負責稀疏全局聚合,在維持精度的同時顯著降低長序列推理過程中的計算、顯存與訪存開銷。拓撲架構方面,傳統殘差連接升級為4支流mHC架構,有助於提升表徵多樣性與泛化能力。自投機模塊則採用3頭MTP架構,一次額外預測3個token,提升模型推理速度。訓練過程中使用Muon優化器,可獲得更快的收斂速度。 此外,這項研究還發現一套正向協同反饋機制:底層性能強勁的基礎推理能力可以直接支撐複雜智能體行為的運行,而智能體的持續運行又會反向迭代優化模型的多階任務規劃能力與長軌跡上下文處理水平。目前,openPangu-2.0-Pro模型的模型權重、基礎推理代碼及技術報告已正式開源上線。 從應用定位來看,智能體應用要求模型能夠執行長程任務、精準調用外部工具,並在長時間運行時保持認知一致性。然而,模型在實際部署過程中往往會暴露出不少問題,例如現有通用框架會帶來不必要的推理資源損耗,拉長上下文長度會拖累模型表現;傳統對齊手段穩定性不足,在運行長週期任務時常出現時間邏輯、層級結構方面的推理問題。 為了解決這些痛點,openPangu-2.0系列模型融合了自研硬件內核、整機系統架構、訓推一體化智能體強化學習算法,搭配專屬推理加速方案,搭建了一套完備的軟硬件協同設計體系,是專門針對長上下文智能體任務所打造。余承東在發布openPangu-2.0-Flash時曾提到,從算法架構到訓練推理,此次盤古模型重點針對昇騰算力進行了優化,並且更深度地開源。昇騰原生訓練的訓練效率提升了30%,且這是業界首個採用DSA加SWA獨立分層混合架構的模型。他也特別強調,這是首個開源預訓練代碼、後訓練代碼、訓推算子的模型。根據Hugging Face的數據,本地離線模型openPangu-2.0-Flash GGUF上月下載量達到39935次。華為還推出了一種專為資源有限環境優化設計的30億參數模型,其中2億為激活參數。 研究人員基於多個公開基準測試評估了openPangu-2.0模型的性能。在通用能力方面,openPangu-2.0-Flash和openPangu-2.0-Pro在多種通用測試中都表現優異,涵蓋上下文學習、指令遵循以及多輪理解能力等面向。在世界知識及事實可靠性測試中,openPangu-2.0-Pro的表現遠超過openPangu-2.0-Flash。華為內部實驗中,研究人員發現,為模型建立扎實的基礎知識及推理能力有助於學習更複雜的智能體行為和編程技能;反過來,在複雜的智能體環境中進行訓練也能明顯提升模型的基本能力,包括指令遵循、長軌跡上下文處理、多步推理以及程序規劃等。此外,在訓練過程中及訓練結束後,持續提供高質量、多樣化的長軌跡智能體數據以及互動環境具有明顯優勢,這也成為未來模型升級的核心策略之一。 從核心架構來看,openPangu-2.0系列模型採用分層混合注意力機制來完成上下文計算解耦:將滑動窗口注意力機制用於稠密局部上下文的處理,將深度稀疏注意力機制用於全局稀疏信息檢索。為了實現推理加速,模型額外搭載了一個三頭多Token預測模塊,並將流形約束超連接與Muon優化器相結合,在固定數據投入量的前提下提升模型收斂速度。研究人員還針對MoE負載均衡、mHC結構穩定性、MTP訓練策略以及Muon參數分組分別設計專屬優化方案,以保障端到端訓練全過程的穩定性。 訓練基礎設施方面,當模型拓展至512K上下文窗口,同時疊加mHC、Muon、MTP等多重複雜基礎架構單元,會帶來更高的通信開銷與顯存佔用瓶頸。為此,研發人員搭建了一套系統化的協同優化框架,融合無冗餘混合上下文並行、面向MTP的輕量化點對點數據傳輸、適配Muon優化器的分佈式計算通信重疊機制以及混合重計算策略;並依託Ascend C專用編程語言定製融合內核,對mHC、參數化注意力匯點、模塊化注意力等模塊進行深度加速。為釋放CloudMatrix 384超節點集群的整體算力,華為也落地了一套精簡且感知網絡拓撲的硬件親和調度策略,將高帶寬數據流約束在超節點內部交互,最大限度減少跨節點數據傳輸開銷,實現硬件資源利用率最大化。 預訓練階段,openPangu-2.0的預訓練語料庫包含約34T tokens。為了優化學習過程,預訓練過程被劃分為三個階段,每個階段都採用特定的數據配方和選擇策略來逐步提升模型能力。第一階段是通用領域,使用25T tokens,重點在於建立扎實的通用知識和廣泛的語言能力基礎。第二階段是推理能力培養,使用8T tokens,著重提升深度推理能力、邏輯思維能力以及高級編程技能。第三階段是退火處理,使用1.4T tokens,目的是優化模型行為和智能體能力,研究人員在此階段特意保留較長的文檔和複雜的軌跡數據,以最大限度提升模型的自主任務處理能力。其預訓練語料庫彙集了網頁、書籍、PDF文件、多語言文本、代碼庫等數據。 後訓練階段則分為三級流水線,包括監督微調、並行強化學習專家訓練、多專家在線策略蒸餾。完成統一監督微調後,系統並行訓練多組強化學習專家模型;各組專家依託獨立數據集與專屬獎勵函數,分別針對邏輯推理、通用問答、智能體交互、代碼生成四大領域優化策略,消除強化學習過程中的跨領域任務干擾。最後藉助在線策略蒸餾完成各路專家能力的融合聚合。 推理加速方面,華為自研了昇騰原生推理框架,實現硬件執行邏輯與模型運行時動態行為耦合。該架構自研多款融合算子,包含面向推理場景優化的mHC算子、專用集合通信原語,同時配套Felix上下文並行、單核多流執行等並行策略。為提升推理吞吐,該框架搭配了定製量化方案與算子感知式保精度量化機制,並集成混合KV緩存管理、無損並行分詞,基於模塊化注意力原生適配自動前綴緩存與MTP技術。在128K上下文長度下,這套框架在昇騰NPU硬件的長上下文推理性能表現為:openPangu-2.0-Flash版本最低TPOT時延可達5.63ms,在TPOT為15ms的工況下單卡NPU生成吞吐1846 token/s;openPangu-2.0-Pro版本最低TPOT時延9.55ms,TPOT 20ms條件下單卡吞吐1326 token/s。 整體而言,基於昇騰平台的硬件與軟件協同設計方法,openPangu-2.0模型解決了大模型訓練、長上下文對齊以及推理效率方面的關鍵瓶頸。華為在技術報告中明確表示,他們的目標不僅僅停留在靜態基準測試的性能上,而是更注重實際系統的實用性。openPangu在戰略上處於有利地位,有望成為智能設備、汽車等領域智能體應用的核心競爭力。 與此同時,華為也在積極擴展基於邊緣計算的能力,利用麒麟處理器架構來突破設備智能化的極限。為了實現這一變革,華為將以昇騰硬件生態系統為基礎,進一步擴展基於沙盒的仿真流程,以在複雜且開放性的場景中生成大量高保真度的執行數據集。未來幾個月,研究人員將持續迭代該模型,目標是在編程和複雜智能體任務方面,系統性地提升openPangu的核心能力。
Related
相關文章
DeepSeek V4 正式版疑定檔 8 月 3 日:硅基流動漲價露馬腳,API 已能答對新題
AI資訊AI新閒資訊正文DeepSeek V4 正式版疑定檔 8 月 3 日:硅基流動漲價露馬腳,API 已能答對新題發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘DeepSeek V4 正式版自 7 月中旬開啟灰度測試後一度跳票,官方至今未公佈確切發佈時間。但多個新證據指向 8 月 3 日可能成為重要節點——硅基流動率先露出馬腳。
AI日報:MiniMax發佈全模態模型H3;Seedance 2.5發佈,30秒一鏡到底;DeepSeek-V4-Flash正式版上線
AI資訊最新AI日報正文AI日報:MiniMax發佈全模態模型H3;Seedance 2.5發佈,30秒一鏡到底;DeepSeek-V4-Flash正式版上線發布於最新AI日報時間 :Jul 31, 2026閱讀 :2分鐘歡迎來到【AI日報】欄目!這裡是你每天探索人工智能世界的指南,每天我們為你呈現AI領域的熱點內容,聚焦開發者,助你洞悉技術趨勢、瞭解創新AI產品應用。
韓國最大 AI 模型問世:LG 發佈 7500 億參數 K-EXAONE 2.0,Apache 開源直面中國模型
LG AI研究院發布韓國最大AI基礎模型K-EXAONE 2.0,總參數達7500億,採用混合注意力MoE架構,並以Apache 2.0許可證完全開源。該模型在多項基準測試中表現優於初代,同時在長上下文理解與智能體工具使用等能力上直接對標智譜GLM-5.1、Qwen3.5等中國開源模型,顯示東亞開源AI競爭加劇。
顛覆影視創作!字節跳動王牌模型Seedance 2. 5 正式發佈, 30 秒一鏡成片時代來了
字節跳動Seed團隊正式推出新一代音視頻聯合生成模型Seedance2.5,主打「一鏡成片」,單次生成時長由15秒提升至30秒,並支援多輪無縫延長。模型強化長敘事、多模態參考與後期編輯能力,並優化材質、光影與膚質,呈現更接近實拍的影視級質感。目前Seedance2.5正陸續登陸即夢AI、豆包專業版,API則將於近期上線火山方舟。
特斯拉中國車機正式接入豆包大模型
特斯拉中國自7月31日起分批次推送2026.14.13版車機軟體更新,涵蓋Model 3、Model Y、Model S與Model X等車型,核心升級是正式導入豆包大模型。該模型可提供即時資訊查詢與自然流暢的語音對話,提升車內智慧互動體驗,但需開通高級車載娛樂服務才能使用。
DeepSeek-V4-Flash API公測上線 Agent能力全面爆發
AI資訊AI新閒資訊正文DeepSeek-V4-Flash API公測上線 Agent能力全面爆發發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘科技圈迎來新一輪效率革命。字節跳動旗下 Seed 團隊正式推出了Seedance2.5音視頻聯合生成模型,主打“一鏡成片”能力,全面賦能多個產業場景。在敘事表現上,Seedance2.