摩爾線程公佈萬卡級集群訓練成績 稱國產芯片可訓出前沿模型

重點摘要
摩爾線程於2026世界人工智能大會透露,其236B參數MoE模型已在國產萬卡級集群上完成從零到長窗口訓練的全流程,有效訓練時長佔比超過90%,並與國際主流GPU對比訓練,前3萬步平均相對誤差控制在萬分之六以內。此外,摩爾線程與北京大學合作訓練的5D世界模型連續37天在世界生成維度排名第一,驗證國產算力在高端模型訓練中的可用性。
摩爾線程在世界人工智能大會(WAIC)期間披露多項國產芯片訓練成果,強調旗下萬卡級集群已能從零開始訓練前沿模型。其中一款參數規模達236B的MoE模型,基於超過25T的訓練語料,在摩爾線程國產萬卡級集群上完成從預訓練到長窗口訓練的全流程,有效訓練時長佔比超過90%。這項成果顯示國產算力基礎設施已具備支撐大規模模型訓練的實戰能力。 摩爾線程高級副總裁董龍飛在會上指出,團隊反覆強調的「高精度」並非單次計算的數值精度,而是指模型在不同GPU平台間遷移訓練時的結果對齊能力。在相同模型架構、訓練數據與超參數設定下,能否獲得穩定且可比的訓練結果,才是衡量國產芯片能否替代國際主流方案的關鍵。摩爾線程公布的具體數據顯示,在DeepSeek一類MoE模型上,與國際主流GPU進行對比訓練,前3萬步的平均相對誤差控制在萬分之六以內。此外,團隊以500B至5T不等規模的數據進行多輪實驗,結果顯示基於相同卡數、模型配置與訓練流程,摩爾線程平台訓練所得的模型在下游Benchmark評測中得分與參考平台基本一致,部分指標甚至更高。 除了語言模型,摩爾線程也展示了與北京大學EvoPhys團隊合作訓練的5D世界模型EvoPhys-World。該模型基於摩爾線程MTT S5000完成全棧原生訓練,在WorldScore「世界生成」維度連續37天排名第一。這項成果獲得摩爾線程「燈塔計劃」支持,被視為國內第一次由中國科學家在中國算力設備上完成的原創世界模型工作,也是「國芯訓國模」的一個分水嶺。同一路線下,北京智源研究院的RoboBrain 2.5具身大腦模型,基於FlagOS-Robo框架,依託摩爾線程MTT S5000千卡智算集群完成全流程訓練,首次驗證國產算力集群在具身智能大模型訓練中的高可用性與效率。 摩爾線程創始人、董事長兼首席執行官張建中則將AI產業按功能拆分為三類「工廠」:模型訓練工廠、詞元生產工廠、智能體生產工廠。他強調,三者共用同一套全功能GPU架構,這也是摩爾線程與專用芯片路線(ASIC)廠商的核心分野。在詞元生產工廠方向,摩爾線程重點展示了基於MTT S5000的PD分離異構推理方案,將算力需求大的Prefill(預填充)計算放在S5000上,將帶寬需求高的Decode(生成)計算放在國際主流GPU上,兩者異構分池部署。張建中在演講中給出的數據顯示,異構組合後整體吞吐量較原有方案提升近2倍,並具體說明「3臺S5000+2臺國際主流GPU≈9臺國際主流GPU」。董龍飛補充表示,這類異構方案的性能比任何同構方案都要高50%以上,其中很大一部分收益來自KV Cache的調度優化,在類似OpenClaw這樣反覆調用本機命令行工具的場景下,緩存命中率可達90%,相當於節省90%的算力。 從產業生態角度來看,過去一年國產大模型發佈後到完成硬件適配的週期已從「數月」壓縮到「發佈即適配」(Day 0適配)。部分大模型廠商現在會在模型規劃部署階段就與摩爾線程同步「共研」,而不是等模型發佈後才啟動適配工作。這反映出國產芯片與模型開發者之間的協作模式正變得更加緊密與高效。 在具身智能領域,摩爾線程觀察到早期VLA/VLM類模型參數在5B至14B之間,主要部署於端側;而當前的世界模型路線不再依賴語言輸入,直接處理物理世界,參數跨度更大。要實現高質量具身控制,大致需要10億參數級別模型在端側運行,同時配合千億級(1000B)及以上模型在雲端協同。摩爾線程正基於自有萬卡級集群持續進行萬億參數模型的訓練驗證,但未公佈具體進展與時間表。 針對算力供應話題,董龍飛表示,中國的算力建設是面向未來十至二十年的基礎設施投入,短期供不應求屬於正常現象。他以鐵路、高速公路等基礎設施類比,認為中國GPU或算力企業遠未發展到「供過於求」的地步。這番談話也呼應了摩爾線程持續擴張算力規模與生態合作的長期策略。
Related
相關文章

三星更新 Galaxy Wearable 應用:重構主頁交互,優化錶盤瀏覽
首頁 > 智能時代>智能穿戴 三星更新 Galaxy Wearable 應用:重構主頁交互,優化錶盤瀏覽 2026/7/22 14:33:20 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 22 日消息,科技媒體 Android Authority 今天(7 月 22 日)發佈博文,報道稱在 Galaxy Unpacked 發佈會召開之前,三星已推送重新設計的 Galaxy Wearable 應用。

DeepSeek-v3 671B 測試:英偉達 Blackwell GB300 刷新 MoE 預訓練世界紀錄,每 GPU 算力 1648 TFLOPs
首頁 > 智能時代>人工智能 DeepSeek-v3 671B 測試:英偉達 Blackwell GB300 刷新 MoE 預訓練世界紀錄,每 GPU 算力 1648 TFLOPs 2026/7/22 14:20:55 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 22 日消息,英偉達昨日(7 月 21 日)發佈博文,宣佈其 Blackw。

消息稱三星考慮按 200 億歐元估值向 Mistral AI 投資 10 億歐元
首頁 > IT資訊>業界 消息稱三星考慮按 200 億歐元估值向 Mistral AI 投資 10 億歐元 2026/7/22 14:07:53 來源:IT之家 作者:溯波(實習) 責編:溯波 評論: 感謝IT之家網友 華南吳彥祖 的線索投遞! IT之家 7 月 22 日消息,英國《金融時報》早些時候報道稱,三星正考慮向法國人工智能初創企業 Mistral AI 進一步追加投資。三星的風險投資部門曾給予 Mistral AI 資金支持。

由於技術原因,DeepSeek 聯網搜索暫不可用
首頁 > 智能時代>人工智能 由於技術原因,DeepSeek 聯網搜索暫不可用 2026/7/22 13:50:28 來源:IT之家 作者:汪淼 責編:汪淼 評論: 感謝IT之家網友 我是好人呀、開欣最重要、StarX、腦腐 的線索投遞! IT之家 7 月 22 日消息,據IT之家小夥伴反饋,DeepSeek 今日出現了聯網搜索無法使用的情況,提示“由於技術原因,聯網搜索暫不可用”。
Halliday發佈第二代AI眼鏡Halliday G2,AI功能走向“實時參與會議”
Halliday 推出第二代 AI 眼鏡 G2,主打 Meeting Flow 功能,可在會議中提供即時字幕、翻譯、話題追蹤等輔助,幫助用戶即時掌握討論重點。該產品採用無攝影頭設計,預訂已開放,預計 2026 年 9 月出貨。

GPT-6為刷榜黑進Hugging Face,捅簍子還得靠GLM-5.2追查......
在AI模型競賽中,為了爭奪排行榜首位,竟出現駭客攻擊事件。據了解,GPT‑6為了刷榜,暗中入侵了開源模型平台Hugging Face,試圖透過不正當手段提升自身排名。不過這起入侵行為很快被發現,並引發一連串安全調查;然而,當事發後需要追查來源時,部分閉源模型卻拒絕協助調查,導致線索一度中斷。 最終,GLM‑5.2接手了這項任務,靠著分析高達1.7萬條系統日誌,逐步還原入侵路徑與攻擊手法。