中國首個十萬卡集群落成!全國產算力支撐“十萬卡時代”

重點摘要
中科曙光在鄭州正式落成全國首個十萬卡AI超集群曙光8000,採用全鏈路國產自研技術,實現十萬張國產加速卡部署與原生超智融合架構。該集群可同時支援科學計算與大模型訓練,目前已適配300餘項應用,並接入國家超算互聯網對外提供算力服務。
中國首個十萬卡集群正式落成,國產算力正式邁入「十萬卡時代」。七月十日,中科曙光在鄭州宣布,全國產 AI 超集群曙光8000(代號登峰)完成部署,並同步接入國家超算互聯網,納入全國一體化算力網。這意味著十萬張國產加速卡已經實際投入運行,並非只是理論上的規格堆疊。從萬卡到十萬卡,絕非單純擴充數量。規模每往上跳一個量級,系統的複雜度便指數級攀升:網路壅塞如何疏通、儲存崩潰如何避免、散熱瓶頸如何突破、調度系統如何不亂——這些工程難題是全新的考驗。曙光8000從底層設計出發,不走過去「堆卡」的老路,而是採用「原生超智融合」架構,讓同一套系統同時勝任科學計算與大模型訓練。
當前許多算力中心面臨結構性錯配:能跑大模型的集群無法執行高精度科學計算,專注科學計算的系統又難以負荷萬億參數模型的訓練。曙光8000的解法是在架構層面就把超算與智算合而為一,從 FP64 雙精度到 INT8 整數精度,實現全精度覆蓋。這不是將兩套系統拼裝在一起,而是從設計之初就將兩種負載視為同一件事。業界雖然不乏「超智融合」的概念討論,但曙光8000是首個基於原生路線打造、並實際落地運行的十萬卡級案例,為國產算力的配置與優化提供了一條具體可行的路徑:透過超智融合平台,將分散的超算中心與智算中心資源池化,實現跨平台、跨架構的統一調度,有助於提升國產算力利用率、降低重複建設成本。
這座集群的工程推進速度同樣令人矚目。中科曙光於2024年啟動系統研製,2025年完成工程建設,今年二月先以三萬卡規模上線試運行,四月再投用六萬卡 AI4S 集群,七月便達成十萬卡全面部署。這背後是中科曙光三十餘年累積的工程實力。據中科曙光高級副總裁李斌介紹,曙光8000在芯片、計算、儲存、網絡、散熱、管理與服務等環節,均具備全國產自研能力。
海光等國產芯片提供底層運算支撐;scaleFabric 類 IB 原生 RDMA 高速網路實現十萬卡規模的高可靠連接;ParaStor 分佈式儲存系統則可支撐大模型訓練與科學計算中的海量數據讀寫,並在2026年全球 IO500 榜單中奪下生產型全節點與10節點性能雙項第一。散熱方面,曙光數創在液冷技術上的核心優勢,讓系統能夠支撐 MW 級高功率密度部署,並透過國產冷媒與全年自然冷卻大幅提升能效。更重要的是,這些工程能力並非只為展示參數。中科曙光已將曙光8000接入國家超算互聯網,以算力服務方式向科研機構與產業界開放。
截至目前,已完成超過三百項應用適配,涵蓋材料、電磁、量子、生物醫藥、天文氣象等二十多個領域,並累計完成七十餘次萬卡規模的算力測試。算力的終極價值在於「用得好」,而非「跑分高」。曙光8000已在真實場景中交出成績單:八萬張卡加速蛋白質摺疊全流程模擬,直接服務新藥研發;八萬八千張卡完成三百二十八萬億網格湍流直接模擬,支撐航空、船舶等高端製造業;九萬張卡協同完成三點一六萬億個原子的 DFT 高精度仿真。這些成果並非紙上數字,而是科研團隊在國產算力平台上實際跑出的世界級進展。曙光8000還採用了 AI 計算開放架構,支援多品牌 AI 加速卡,並相容主流生態。
這意味著一線開發者與科研人員無需重新學習封閉工具鏈,既有的模型與應用能夠快速遷移上線。開放架構也讓整個產業鏈都能參與協作,而非單一廠商獨攬全局。在大會期間,中科曙光更與北京科學智能研究院達成戰略合作,正式啟動第二套全國產十萬卡超智融合算力系統的研製與建設,曙光8000正從一個示範工程走向可複製的標準方案。選擇鄭州作為曙光8000的落腳點,也蘊含深層戰略考量。鄭州的區位優勢、能源條件與網絡節點地位,使其天然適合擔當連接東西部算力的樞紐。這一部署意味著國家算力網的骨幹節點已具備十萬卡級的承載能力。當更多同等級節點在全國鋪開,中國將率先織成全球最大規模的算力調度網絡。
從一座集群到一張網路,曙光8000的落成不僅是技術面的突破,更為算力像電力一樣流動的願景,打下了堅實的基礎。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。