WAIC直擊 | 十大開源社區「擠」進了一家GPU展臺,沐曦憑什麼?

重點摘要
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> WAIC直擊 | 十大開源社區「擠」進了一家GPU展臺,沐曦憑什麼?
每年 WAIC 開展的第一天,現場總是擠滿了探索最新技術的人潮。今年在上海,幾個關鍵詞特別突出:超節點、大模型、Agent、AI4S。其中一家 GPU 廠商沐曦,幾乎把所有新產品都搬到了展臺上——曦景 S600 超節點首次公開亮相,單機櫃就能安裝 64 張 GPU,並可擴展到萬卡規模;針對科學智能領域的曦索 X300 系列 GPU 也是首度發佈;一旁還有 Agent 體驗區,排隊人潮從未間斷。理論上這些已經足夠撐起一個 GPU 展臺的主角光環,但真正吸引目光的,反而是展區中央的那一整塊區域——被刻意留給了十個開源社區。
這十個社區的標誌一字排開,包括龍蜥、vLLM、PyTorch 基金會、SGLang 等,沐曦甚至特地設計了一條開源社區打卡路線。一家 GPU 公司為何要把最顯眼的位置之一交給開源?答案得從他們的軟體棧 MXMACA 開始說起。在算力領域待久了的人都清楚,NVIDIA 能站穩龍頭,靠的不只是單顆晶片硬體性能。製程、架構、記憶體這些硬指標,國產廠商咬牙追趕總有機會縮小差距;真正難攻的,是藏在硬體之下的 CUDA 軟體生態。數百萬開發者的專案代碼與經驗全沉澱在上面,換一張算力卡,等於要把多年的技術積累大幅翻新,遷移成本讓多數團隊卻步。
沐曦自研的全棧計算軟體 MXMACA,正是為解決這個問題而生——從編譯器、底層算子函式庫,一路涵蓋到主流 AI 訓練推理框架,目標是讓開發者原有的代碼幾乎不必改動就能直接運行在沐曦 GPU 上。這套「近零成本」遷移已經獲得驗證。沐曦建置了一套自動化測試系統,納入 GitHub 上近 5000 個熱門開源專案,每次 MXMACA 版本更新都跑一次完整測試,結果顯示 92% 的專案一行代碼都不用改就能正常運作。針對 PyTorch 2.8,MXMACA 做到了全部 2410 個 GPU 算子的完整相容,而且每次 PyTorch 出新版本,沐曦一週內就能完成適配,遠快於業界常見的數個月。
在 vLLM 生態裡,兩百多款大模型中沐曦只深度調試了五六十款主流型號,剩下的交給普通本科生去測試,最後僅十來款出現適配障礙,絕大多數開箱即用。這些數據都顯示 MXMACA 的通用相容性相當紮實。不過,讓代碼跑起來只是第一步。真正的新挑戰來自 AI 爆發後,大模型從訓練完成到上線服務的週期被壓到極短,廠商都希望在模型一升級就立刻獲得收益。然而行業技術更新幾乎沒有間歇,完全依賴封閉自研的軟體棧根本跟不上速度。沐曦團隊直言:「對於我們這樣一個追趕者來說,需要以開源的方式來打破領先者閉源的壟斷。」也早在 GPU 正式量產之前,沐曦就已完成了 1752 款開源軟體的適配,並將開源共建納入長期戰略。
沐曦的開源策略用一句話總結就是「upstream first」。過去多數廠商的做法是「社區發新版本,自己拉下來適配」,拉源碼、下補丁、編譯、除錯一整套;upstream first 則是直接把代碼貢獻回上游社區,與社區一起迭代。開發者從 vLLM 社區拉下代碼,pip 一裝就能直接跑,因為沐曦的支援代碼本來就長在社區裡。截至目前,沐曦已開源 53 個軟體倉庫,約占整個軟體棧的 15% 到 20%,且還在持續擴大。
一個標誌性事件是沐曦成為中國第一家與 vLLM 官方簽署合作協議的晶片企業,也是全球美國晶片公司之外的第一家,合作涵蓋軟體適配、開源活動與商業協同,沐曦硬體也進入了 Red Hat 與 vLLM 的官方硬體貨架。回頭再看展臺上那十個社區,它們恰好對應一個 Token 穿過每一層運算環節:最底層是作業系統與資源排程(龍蜥、Red Hat、CNCF、蜜瓜智能),往上則是訓練與推理框架(vLLM、SGLang、PyTorch 基金會、九源聯合體),最上層對應開源生態運營與合規治理(模力方舟、木蘭開源社區)。沐曦曾與木蘭社區共同制定開源規範與大模型分級標準,確保每個 Token 的輸出安全合規。
此外,沐曦也投入編譯器 TileLang 的共建,這套由北京大學團隊研發的編譯器,讓國內有了端到端自主可控的技術路線,今年多款主流大模型的核心算子就是靠它寫出來的。人才培養也是重點。沐曦圍繞 TileLang 開設多期實戰訓練營,累計吸引 500 多名開發者;規劃的 6 本教材已出版 4 本,8 大基礎課程進入 20 多所高校。沐曦也與上海 AI 實驗室合作開辦實戰營,讓學生從數據收集、模型訓練一路做到評測與應用,所有課程與工程代碼均對外開源。在社區表現突出的在校學生還能獲得免試入職實習的機會。沐曦的目標是持續開放核心軟體棧,讓生態自然長出來。
沐曦 CTO 楊建博士給了一個明確的比喻——希望 MXMACA 成為「AI 時代的 Android」。也就是持續開放全棧軟體,打通從作業系統、大數據處理到大模型訓練推理與私有化部署的完整鏈條,讓客戶與其他晶片廠商都能基於這套軟體棧搭起通用好用的底層算力生態。他提到,一個小白用戶可能一個下午就能完成新應用的適配。早在 2023 年,沐曦就曾讓一名大二學生在一天內跑完一款開源軟體的適配、驗證與部署。楊建估計,未來全球 700 萬 GPU 與 AI 開發從業者中,至少 650 萬人在接觸沐曦工具鏈後,一天內即可快速上手。
沐曦目前生態約有 50 萬開發者,長期目標是到 2029、2030 年擴充到 500 萬。至於眼前 Agent 浪潮的爆發,沐曦形容正處於「類寒武紀時代」,各類智能體方案集中湧現,但大量 Token 被消耗在無效調用上。好消息是開源世界裡各方都在「透明卷」——今天有人開源降低 Token 算力消耗的新技術,明天可能就有高校團隊放出演進版,所有優化都公開競爭。沐曦分享了一個真實案例:一家互聯網公司的產品經理找上門要做模型適配,中途出去用餐,回來就告訴沐曦適配已經做完了,用的是 AI 程式設計工具配上模型權重與沐曦公開文檔,一頓飯的工夫腳本就跑通了。
這件事讓沐曦也感到意外,但也說明了文檔夠開放、軟體棧夠兼容時,連不寫程式的人都能借助 AI 參與共建。展區那句「每個 Token 背後,都是一次開源協作」,如今有了新的註解——連 AI 自己產出的 Token,也在參與這場協作。沐曦始終想扮演的角色是中國開源算力生態的領軍者,靠開源底座串聯產學研用,讓每個環節都建立在開源共享之上。每一個流暢生成的 Token,都是對整套協作鏈路的驗證,而沐曦要做的,就是讓每個 Token 的價值都被真正實現。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。