DeepSeek 開源算子工具大禮包,聯手華為昇騰,手撕 CUDA 綁定!

2026年9月30日 18:57
DeepSeek 開源算子工具大禮包,聯手華為昇騰,手撕 CUDA 綁定!
站內 AI 整理稿

本文作者: 高允毅 2026-09-30 18:58 導語:一套代碼能跑遍所有芯片。一套代碼能跑遍所有芯片。作者丨高允毅 編輯丨岑 峰 剛剛,DeepSeek做了一個開源壯舉:把給英偉達 GPU 寫代碼的全套工具鏈,原樣鋪到了華為昇騰 950 NPU 上。最核心的算子開發產品 TileLang 官宣原生支持昇騰。不僅如此,連同 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大核心計算與通信庫也同步推出昇騰版本,直接對標英偉達平臺的全套工具鏈。這意味著國產算力第一次在核心算子工具層面,做到了與英偉達生態的能力對標。

在此之前,全球 AI 行業苦 CUDA 壟斷久矣;而現在,DeepSeek 用一行行開源代碼,為國產算力自主生態蹚出了一條康莊大道。01寫算子的 “手工作坊” 時代,該結束了做過 AI 底層開發的都知道,“寫算子”一直是門檻最高、耗時最久的工作之一。一張芯片的理論算力上限很高,但如果底層算子寫得不達標,芯片內部的計算單元就會有大量時間等數據流轉,導致幾萬塊錢的芯片可能只能發揮出 20% 的性能。寫算子的目的,就是為了把這 20% 的硬件利用率提高到 95% 以上。

拿最常見的矩陣乘法(GEMM)來說,要想榨乾一張 AI 芯片的算力,開發者要手動管理三級緩存、調度線程塊、搞定數據預取流水線,甚至要深入到寄存器分塊和指令重排層面。為了優化上千行底層代碼,資深工程師打磨好幾周都是常態。這就導致了一個行業的核心衝突:模型算法迭代太快,芯片廠商官方算子庫永遠跟不上。

過去行業裡有三條路可選,但各有各的侷限:第一條路是自己手寫 CUDA:性能天花板最高,但開發效率極低,深度綁定英偉達生態,無法跨平臺移植;第二條路是使用廠商的預製算子庫:比如英偉達 cuBLAS,標準算子開箱即用、性能拉滿,但靈活性極差,開發者無法修改內部邏輯、也無法做算子融合,新算法很容易卡在算力層;第三條路是使用高層 DSL 編譯器:比如 OpenAI 的 Triton,大幅降低了開發門檻,但性能上限受限於編譯器本身的優化策略,對昇騰、AMD 等非英偉達硬件原生支持度低,異構適配成本很高。

而 TileLang 開闢了第四條路,終結算子開發的 “手工作坊” 模式,同時兼顧開發靈活性、運行性能與跨平臺能力。它的核心是多級分塊(Tiling),將龐大計算任務切分成標準化的數據塊。開發者只需聲明 “每塊數據在哪裡計算”,編譯器自動完成數據搬運、線程同步等底層工作,性能直逼手寫 CUDA 的硬件上限。這本質上是把資深工程師手工調優的成熟思路抽象為標準化編程原語。TileLang 主攻大模型核心算子:通用矩陣乘法、反量化 GEMM、FlashAttention、線性注意力、稀疏 MLA。這些算子承載大模型訓練和推理 90% 以上計算量,直接決定 AI 芯片算力利用率。

算子速度每提升一倍,都意味著大模型訓練成本下降、推理效率提升,從而大幅攤薄算力成本。DeepSeek 能夠把 API 價格打到行業極致,除了模型架構本身的精妙設計,還因為底層擁有這套極高效的自研算子工具鏈 TileLang。02站在 TVM 肩膀上,性能跑進全球第一梯隊從技術角度而言,TileLang 沒有從零去寫一套完整編譯器,它複用了 Apache TVM 現成的編譯能力。Apache TVM 是華盛頓大學陳天奇團隊開發的開源機器學習編譯器框架,現為 Apache 頂級項目,在 AI 界的地位相當於 LLVM 在編程語言界的地位。

它的作用是 AI 芯片與大模型之間的“萬能翻譯官兼超級優化師”,不管上層是什麼框架,底層是什麼芯片,它都能編譯成適合該芯片的高性能機器碼。TileLang 在 TVM 之上包裝了一層簡單好用的語法,專門處理大模型裡最重要的分塊計算。開發者不用關心底層硬件細節,只用很少代碼,就能把芯片算力跑到接近上限。TileLang 最早由北京大學團隊在 TVM 編譯器基礎設施上孵化。DeepSeek 把它接過去、推到生產,再反向捐贈給開源社區。截至 2026 年 9 月,倉庫收穫 7.6k stars、1,992 次 commit,已經成為事實上的國產 DSL 標杆。

它的效果可以用官方基準數據說話:基於 TileLang 優化的 DeepSeek V3.2 稀疏注意力 TopK 算子,比原生 PyTorch 快 2–20 倍;其推理中最核心的 MLA、FlashAttention、LinearAttention 等算子,也已全部提供可直接商用的極致優化實現。同樣在英偉達 H100 上運行核心算子,TileLang 的速度大幅超越了 Meta 的 PyTorch 原生實現。要知道,PyTorch 是目前全球使用人數最多、生態最龐大的 AI 核心框架,絕大多數主流大模型都基於它搭建。同時,它也擊敗了 OpenAI 的主力加速工具 Triton。

Triton 是 OpenAI 傾力打造的、全球開源社區公認最主流的第三方加速標杆,世界頂級的大模型公司都在用它來壓榨英偉達芯片的算力。圖注:H100 上各底層框架的 MLA 解碼性能對比,相比傳統和通用框架,FlashMLA 與 TileLang 具備極佳的硬件算力釋放效率它甚至追平了英偉達官方調校的 cuBLAS 以及官方版 FlashAttention,直接進入全球頂尖性能的第一梯隊。要注意的是,英偉達官方工具只支持自家芯片,而 TileLang 具有跨平臺能力,在 AMD 頂級芯片 MI300X 上跑,同樣拿到了接近硬件極限的跑分數據。

03TileLang 架構深度拆解:為什麼一套代碼能跑遍所有芯片TileLang 能用同一套編譯器,靈活切換不同的芯片,核心在於從設計之初就採用了“前後端解耦,目標與執行分離”的架構。傳統編譯器的痛點在於,把 “為哪款芯片生成指令” 和 “怎麼編譯加載運行” 兩件事深度綁定。換一款芯片,整套邏輯都要推倒重來。而TileLang 把這兩件事徹底拆開:目標後端:只負責定義這款硬件的指令語法、優化規則,是硬件專屬部分;執行後端:只負責通用的編譯、加載、啟動流程,和具體硬件無關。每當新芯片適配時,執行後端完全不用改動,只需要新增一個對應的目標後端即可。

每個目標後端都遵循統一的四層流水線結構,上層通用代碼輸入後,會逐步翻譯成對應芯片的底層指令: 第一層是語言方言(Dialect),把代碼翻譯成每家芯片能聽懂的指令像針對英偉達 CUDA 後端:它負責翻譯並注入 WGMMA 和 TCGEN05 等張量核心指令;針對 AMD ROCm 後端:它對應翻譯為 MFMA 和 WMMA 核心架構指令;針對華為昇騰後端:它則負責翻譯為 Ascend C 的底層向量指令與矩陣運算原語。第二層是上下文貢獻(Context)。這一層要感知你當前跑的是什麼芯片,並把不同硬件的規格參數統一轉換成標準格式;記錄整個編譯過程的狀態,保證前後一致。

第三層是Pass 流水線(Pass Pipeline),這是整個流程最核心的翻譯優化環節,要把高層邏輯轉換成芯片能跑的底層代碼,並且針對不同芯片做不同優化。第四層是主機 / 設備代碼生成(Codegen)層,把優化好的代碼拆成兩份,主機側代碼運行在 CPU 上,負責任務調度;設備側代碼跑在 AI 加速器上,承擔核心計算,兩段代碼組合完成最終編譯與執行。

截至目前,TileLang 覆蓋主流 AI 算力平臺:英偉達 CUDA 是核心主力,擁有最完整的功能和優化;AMD ROCm、蘋果 Metal、華為昇騰 950 為官方支持級;LLVM CPU、WebGPU、CuTe DSL 等處於實驗階段;沐曦、摩爾線程、海光等國產芯片則通過生態項目適配,基本覆蓋了國內外主流 AI 算力平臺。這套解耦架構不僅解決了跨硬件適配的難題,還向上開放了精細化的硬件控制力。開發者只用接近 Python 的簡潔語法,就能對底層硬件做精準操控,最終跑出媲美手寫 CUDA 的性能。控制算子運行效率的核心,在於三個維度:存儲控制、線程調度、並行節奏。

TileLang 允許開發者直接在高級的 Python 代碼中,對這三個底層維度進行顯式控制。存儲控制(數據放哪):芯片內部有三層存儲。全局內存容量最大,但速度最慢;共享內存速度中等;寄存器容量最小,訪問速度最快。TileLang 允許開發者在 Python 中直接用代碼決定數據放在哪一層存儲裡,避免計算單元因為等待數據而閒置。線程調度(任務怎麼分):TileLang 通過一句代碼,就能把龐大的矩陣計算像 “劃分網格” 一樣,精準分配給芯片裡成千上萬個計算核心。

例如把一個巨大的計算切分成 100 份任務,在芯片上拉起 100 組計算單元(線程塊),每組裡面跑 128 條併發工序(線程),多路並行同時開工。並行節奏(傳輸和計算怎麼併發):TileLang 用一句 T.Pipelined(numstages=3) 直接開啟三級軟件流水線,讓數據搬運和算力計算異步並行,一邊搬數據一邊算數據,絕不讓芯片閒著。用這三個維度編寫的通用矩陣乘法(GEMM)算子,可以把傳統 CUDA 實現通常需要 500 行以上的代碼,直接壓縮到 30 多行 Python 代碼。

04押注華為昇騰,DeepSeek 最大的賭注9 月 21 日,據《The Information》報道,在投資人閉門會上,梁文鋒將“使用華為或其他國產芯片訓練模型”描述為公司當前“最大的賭注之一”,並明確表示此役“必須成功”。據彭博社此前報道,DeepSeek 已投入 25.6 億美元的訂單,採購至少 16 萬顆華為昇騰 950DT 加速器,用於部署在內蒙古烏蘭察布在建的吉瓦級數據中心,這筆訂單最快 2026 年 Q4 開始交付。這批昇騰 950DT 主要面向推理側,訓練環節目前仍主要依賴英偉達。在算力佈局上,DeepSeek 沒有將國產芯片視為英偉達的退路,而是被擺在了核心戰略位。

梁文鋒的判斷是,國產芯片走向全球一線只是時間問題,DeepSeek應該率先行動,適應英偉達之外的半導體硬件。DeepSeek 轉向昇騰,其背後仍有三個難關。第一塊:訓練軟件棧全部重寫。DeepSeek-V3、V4 的訓練代碼,最早是為英偉達的 Tensor Core / Hopper 架構 WGMMA 指令寫的。要在昇騰上跑,必須把每一處 cuBLAS / NCCL 調用替換成 Ascend C / HCCL。同時,FlashMLA、DeepEP、DeepGEMM 這些自研核心算子,要逐一在昇騰 950 上驗證性能。第二塊:通信原語底層替換。

大模型訓練要在成千上萬顆加速器之間同步梯度,通信原語是並行訓練的基石。英偉達生態的 NCCL 與昇騰體系的 HCCL,在 API 設計、性能曲線、容錯模型上完全不同。從 NCCL 到 HCCL 的遷移不是改個 import 那麼簡單,任何一個集合通信操作的適配偏差,都可能導致整輪訓練靜默失效。第三塊:芯片產能押注。更隱蔽的風險藏在供應鏈。推動 DeepSeek 轉向國產芯片的動因是美國出口管制,而同一管制政策也制約著華為擴大 Ascend 950 產能的能力。DeepSeek 押注 16 萬顆昇騰的隱含前提是:華為的 Q4 交付不能掉鏈子。

目前,DeepSeek 正在訓練一款 2 萬億參數的大模型,參數規模超過現有旗艦 V4 的 1.6 萬億;梁文鋒同時透露,公司已規劃 8 萬億參數的更大模型。模型規模越大,訓練與推理對算力的需求就呈指數級增長。據梁文鋒此前估算,訓練一款與 OpenAI 同級別的大模型,大約需要 5 萬顆英偉達 GB300 處理器,對應需要 20 萬顆華為昇騰 950 芯片。儘管 DeepSeek 全力推進國產算力遷移,但現實是華為當前的芯片供貨仍有缺口。知情人士透露,受先進內存等核心元器件短缺影響,華為正面臨生產瓶頸,DeepSeek 短期內仍無法完全擺脫對英偉達硬件的依賴。

為此,DeepSeek 已完成多輪大規模融資,持續投入算力擴張。未來 12 個月裡,至少有 4 個變量會決定這場賭局的勝負:華為 Ascend 950 的 Q4 交付率,決定 DeepSeek 訓練時間表;TileLang 昇騰後端是否能在 6 個月內追平 CUDA 後端,決定開發效率;字節、騰訊、阿里是否跟隨押注昇騰,決定生態規模;美國出口管制是否再次升級,決定這條路的下限。這些問題裡,還沒有定論。但一個趨勢已經清晰,TileLang 的開源,把“國產算力生態怎麼建”這件事,從一個工程問題變成了一個生態問題。

對比 CUDA 與 TileLang,兩者代表了兩種完全不同的生態路線:CUDA 是閉源、全棧、硬件綁定的廠商主導生態,積累深厚但遷移成本極高;TileLang 是開源、聚焦、跨硬件的社區化工具,專注解決大模型最核心的算子開發問題,靈活度高、移植成本低。TileLang 的意義不在於替代 CUDA,而是補上了當下最緊迫的短板,讓國產芯片不需要從零搭建完整的軟件生態,就能快速擁有大模型訓練所需的頂級算子能力。當越來越多的大模型廠商基於 TileLang 開發算子,國產芯片的適配成本會指數級下降,整個生態的迭代速度也會大幅加快。

某種意義上,DeepSeek證明了用國產芯片,一樣能堆出世界級規模的超算集群。當大模型競爭進入算力成本與供應鏈安全的深水區,“用軟件定義算力” 不再是一句口號,TileLang 這樣的底層工具創新,正在悄然重構國產算力生態的格局。參考鏈接:https://github.com/tile-ai/tilelanghttps://www.theinformation.com/articles/deepseek-bets-big-huawei-chips-bypass-u-s-export-controls?

utmcampaign=Editorial&utmcontent=Article&utmmedium=organicsocial&utmsource=threads,twitter&__cfchlrt_tk=iW7ZBFXRrEVuB9NBtCSW3X3dfxuUsmhAeiCUuxwa9RI-1790041475-1.0.1.1-NZ2.jEQlxsBBSsJDT6m6kKkiC9ImC8gHkVtqSlKM8iI上車,(公眾號:)帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。

詳情見轉載須知。0人收藏 分享: 相關文章 算子 DeepSeek 華為昇騰 對比 Codex,免費的 AgnesCode 也能在底層算子優化任 ...對比 Codex,免費的 AgnesCode 也能在底層算子優化任 ...像素級對標?智譜、Kimi 底層參數「撞衫」背後,藏著 ...基於架構創新,後摩智能點亮業內首款存算一體大算力 ...高允毅 編輯 發私信 當月熱門文章 深度解讀:關於 Jev 的幾大疑問 GPT-6 Sol 降價 50% 的秘密:消失的 Terra,一場模型梯隊平移 GPT-6 砍掉思考 Token,俄羅斯人砍掉通信 Token,Token 經濟開始崩了?

梁文鋒狙擊戰:深扒那些梁文鋒署名的論文有多牛 深度解讀 DeepSeek V4.1 Flash 全新架構,如何成為顯存殺手 最新文章 Muse爆火,dots入場:Personal Agent開始和互聯網平臺搶入口 實測 Qwen-3.8 與 GLM-5.3 的 Flash 版:誰能讓我提前下班半小時?從 Codex Harness 開源,看 AI 公司的護城河是什麼?全網最硬核 OpenClaw 2.0 實測:從 ToC 到 ToB 的試探,Agent 網關能重塑工作流邊界嗎?

對比 Codex,免費的 AgnesCode 也能在底層算子優化任務中打得有來有回 從海拉魯到現實世界:視頻模型如何理解「變化」 熱門搜索 百度 電動汽車 支付寶 iPhone 6S HoloLens 字節 特朗普 槽點 叫獸發言 蘋果公司 處理器

Related

相關文章

鈦媒體模型更新

個人Agent,人邁向硅基的第一步?

字母AI2026.09.30 19:17 · 來自北京全文5353字00:00 / 15:05信奉硬件為王的蘋果,天要塌了?文 | 字母AI9月初,Meta的Muse上線,不到兩週登上美國App Store免費榜首,Sensor Tower估算截至9月24日累計下載量超過340萬次。

剛剛
鈦媒體模型更新

大廠們正在集體搶灘“AI個人助理”

影子備忘錄2026.09.30 18:43 · 來自廣東全文5027字00:00 / 13:14一場圍繞AI個人助理的集體押注正在上演。文 | 影子備忘錄2026年9月8日,Meta的AI個人助理Muse在北美上線。兩週後,這款產品登頂美加iOS免費榜,下載量突破340萬次。

剛剛

豆包AI個人助手獨立App實錘:定名“小豆”劍指全場景智能生態

據最新消息顯示,豆包此前在個人助理方向推進的探索項目(代號“Spell”)已正式定名為“小豆”,並且計劃推出獨立的App版本。這一名稱早在今年暑期就已經敲定。目前,該產品正處於緊鑼密鼓的內部測試階段,未來面向大眾的最終對外版本可能會根據實際測試情況進行調整,官方尚未公佈確切的上線時間。

剛剛
雷峰網模型更新

從 Codex Harness 開源,看 AI 公司的護城河是什麼?

本文作者: 李娜 2026-09-30 16:24 導語:技術領先非護城河,開源意在沉澱轉換成本、規模與反饋。8 月 19 日,OpenAI 正式開源了 Codex Harness。這家公司名字裡的 Open,久違地兌現了一次。((公眾號:))長期深耕 Agent Harness 的開發者群體對該消息的普遍反饋是“振奮”。

剛剛