deepseek為什麼要在此時擁抱華為?

影子備忘錄2026.10.02 09:56 · 來自廣東全文4161字00:00 / 11:24這不是一次適配,這是一次搬家。文 | 影子備忘錄國慶假期前一天,DeepSeek放出了一條一則消息:正式開源面向華為昇騰算力平臺的基礎設施組件,涵蓋TileLang高級語言編譯工具、高性能計算庫與分佈式通信庫,所有組件與此前面向英偉達平臺的開源組件一一對應。如果你只把這當作一次普通的“國產適配”,那可能會錯過這件事真正的分量。過去幾年,國產芯片適配大模型的新聞並不少見,但大多是“能在上面跑起來”的層面,比如驗證兼容性,刷個適配公告,然後就沒有然後了。
不過這次不一樣,因為DeepSeek把自己在英偉達平臺上打磨成熟的那套工具鏈,幾乎完整地、成體系地搬到了昇騰上,而且關鍵測試中的計算與通信性能已經接近硬件上限。這不是一次適配,這是一次搬家。算力焦慮的盡頭,是別無選擇要理解DeepSeek為什麼在此時選擇華為,得先理解這家公司正面臨什麼。梁文鋒在今年7月的一場閉門投資者會議上,說了一句非常坦率的話:中美AI能力之間的差距,包括人才、模型性能和應用等都可以歸結為一個變量,算力資源。他透露DeepSeek目前運營著約2萬塊英偉達H系列同等算力的芯片,但無法採購到足夠的硬件來訓練最大規模的前沿模型。
他估算,訓練頂級大模型可能需要約5萬顆英偉達GB300芯片,若採用華為昇騰950,則可能需要約20萬顆。“今年能花出去200億人民幣,就說明我們的採購團隊表現出色了。要花到這個數實在太難了。芯片買不到,價格還高。”這段話裡有兩層意思。第一層是外部供應的不確定性,主要是出口管制持續收緊,英偉達對華特供芯片的供應既不充足也不穩定。第二層是即便買到了,成本也高得令人窒息。DeepSeek V4-Pro的API輸入價格低至0.25元/百萬詞元,而GPT-5.5 Pro加權平均輸入價格為30美元/百萬詞元,兩者相差超過700倍。這種極致性價比的定價策略,要求基礎設施成本必須被壓到極限。
而英偉達芯片的採購價格擺在那裡,再怎麼優化,成本曲線也降不下來。相比之下,華為昇騰新款推理芯片的採購價格僅為英偉達的四分之一,單卡算力卻比英偉達對華特供版提升了2.87倍。梁文鋒對華為昇騰950超節點的評價是:“在性能和價格上完全可以平替英偉達的GB200和GB300。”這就不難理解為什麼DeepSeek把使用華為等國產芯片訓練大模型列為重要戰略方向。據彭博社報道,DeepSeek已向華為訂購了16萬顆昇騰950DT芯片,用於其位於內蒙古的1GW數據中心。梁文鋒甚至說,這項工作“必須成功”。TileLang這步棋,走在了所有人前面但僅僅因為“買不到英偉達芯片”就去擁抱華為,這個敘事太單薄了。
真正值得拆解的,是DeepSeek選擇合作的技術路徑。答案藏在TileLang裡。這家公司從訓練V3模型開始,就在做一件很多同行沒有做的事情,他們正在用自研的TileLang高級語言來寫算子,而不是直接調用CUDA。TileLang的設計思路是:讓開發者用更簡潔的高級語言編程,同時通過編譯器優化達到接近硬件性能上限的執行效率。目前,DeepSeek V4系列模型訓練中大部分算子已經基於TileLang實現。這也意味著DeepSeek在英偉達平臺上構建模型時,並沒有把自己和CUDA生態綁死。TileLang扮演了一層抽象,往上承接模型訓練的邏輯,往下對接芯片的底層指令。
當這層抽象被移植到昇騰平臺時,對昇騰Ascend C底層指令進行封裝,開發者的代碼邏輯幾乎不需要重寫。從目前的情況來看,梁文鋒確實把這條路走通了。華為950超節點“四顆芯片的算力相當於一顆英偉達芯片”,雙方在芯片本身仍存在“四倍加兩年”的差距,但生態適配的障礙已經被跨過去了。對比一下OpenAI和Anthropic的做法,這條路徑的獨特性就更清楚了。OpenAI選擇的是自研芯片,他們與博通合作開發了Jalapeño推理加速器,同時與Cerebras簽署了超過200億美元的算力服務協議,走的是“定製硬件+多元供應商”的路子。Anthropic則在模型性能上持續加碼,Sonnet 5.
5在編碼基準上已經超越了自家旗艦Opus 5.5,同時成本只有GPT-6 Sol的五分之一。兩家美國頭部公司,一家向左往硬件深處走,一家向右往模型效率走,但都沒有走“把一個成熟的軟件工具鏈跨平臺移植”這條路。DeepSeek走的是第三條路。它的賭注在於:軟件工具鏈的可移植性,可能比芯片本身的性能差距更重要。當TileLang在昇騰上跑通,所有使用TileLang的開發者,理論上都可以在昇騰上構建模型,而不需要重新學習一套編程範式。
華為也將本次聯合創新的成果在CANN社區開源,覆蓋大EP低延時推理部署、單卡/單機部署、大規模訓練、超長文本KVcache池化與Agentic RL,開發者拿到的是可以直接用的實踐方案。不只是DeepSeek一家的選擇如果把視角拉遠一些,會發現DeepSeek的決策並非孤立事件。智譜AI在今年1月聯合華為開源了GLM-Image,這是首個完全基於國產芯片(昇騰Atlas 800T A2)和昇思MindSpore框架完成全流程訓練的SOTA多模態模型。
到了2月,智譜完全使用華為昇騰910C芯片訓練的7440億參數GLM-5模型,在“人類最後的考試”基準測試中登上了榜首,全程沒有使用任何英偉達GPU。阿里通義千問、字節豆包、百川智能等頭部玩家,都在同步推進國產算力適配。彭博行業研究的一項調查顯示,中國企業計劃在未來12個月內將46%的AI加速芯片預算用於採購國內芯片,遠高於目前的30%。深圳已經投運了基於昇騰910C的1萬卡AI算力集群,預約率達到92%。這不是一兩家公司的孤勇,而是一個行業在供應鏈約束下的集體戰略調整。
區別在於,DeepSeek這次做的是“從根上”解決問題,而不是簡單地讓模型能在國產芯片上跑,這是在國產芯片上構建一套完整的、從編譯工具到通信庫的基礎設施。華為向DeepSeek提供的昇騰超節點SuperPoD Flex和UBL128組網方案,可實現128卡3.2Tbps單層交換的Scale-up網絡和256K卡兩層交換的Scale-out網絡,兼顧超低時延推理與前沿基座模型的大規模訓練需求。DeepSeek團隊開發的DeepEP通信庫,實測互聯帶寬達到Dispatch 375 GB/s、Combine 347 GB/s,已經接近硬件上限。
這些數字說明,至少在超節點這種大規模並行計算的場景下,昇騰平臺的通信效率已經達到了可用的水平。軟件生態才是真正的護城河回過頭來看,DeepSeek選擇在這個時間點與華為深度合作,還有一個容易被忽略的考量。英偉達的CUDA生態之所以牢固,核心不在於芯片本身,而在於十餘年積累的數百萬開發者、成熟的工具鏈和豐富的代碼庫。換成硬件容易,換成生態極難。梁文鋒對此的判斷是:CUDA的護城河正在“迅速瓦解”,中國AI芯片產業正面臨取代外國硬件的“歷史性機遇”。他預測,在一年之內,實際部署情況將顛覆市場上認為國產芯片生態“不可用或難以使用”的看法。這話聽起來像是樂觀主義者的宣言。
但從技術角度看,他手裡確實有幾張牌。TileLang本身就是一張牌。它的定位是比CUDA更簡單的高級語言,能顯著提高開發效率、簡化代碼邏輯,同時不損失硬件性能。如果TileLang的昇騰版本能夠吸引足夠多的開發者使用,那它就構成了一條繞過CUDA的通道,最終的結果是開發者不需要學CUDA,只需要學TileLang,就能在兩種芯片平臺上部署模型。DeepSeek把TileLang昇騰版本開源,並明確表示希望“對更多AI芯片建立高可用軟件生態起到示範作用”,這背後的意圖再清晰不過了。另一張牌是DeepSeek自身開源模型的號召力。
DeepSeek V4系列是目前全球開源大模型中最受關注的之一,開發者基數龐大。當這些開發者習慣了用DeepSeek的模型和工具鏈,遷移成本就自然降低了。而如果昇騰平臺能夠提供與英偉達平臺“一一對應”的組件,遷移就變成了換一個pip install的事。當然,樂觀歸樂觀,現實中的挑戰也不容迴避。梁文鋒坦承,華為的產能是當前最主要的瓶頸。華為昇騰950DT的年產量僅有幾十萬顆,DeepSeek那筆16萬顆的訂單可能需要長達一年才能交付。華為自身也承認,由於產能受限、國內需求旺盛,下一代昇騰900系列將主要面向中國市場供應,暫不會全面推向海外。產能問題不解決,生態的雪球就滾不起來。
寫在最後站在2026年秋天回看,DeepSeek與華為昇騰的合作,與其說是一個“去英偉達化”的故事,不如說是一個關於“選擇權”的故事。過去幾年,中國AI公司在大模型訓練上幾乎只有一條路:買英偉達芯片,用CUDA生態,在既定的遊戲規則裡競爭。出口管制收緊之後,這條路越來越窄,成本越來越高。DeepSeek的選擇是與其在一條越來越窄的路上掙扎,不如和芯片廠商一起,把第二條路修出來。至於這條路修得怎麼樣,現在還不好下定論。TileLang能否成為真正的“中國版CUDA”的雛形,昇騰的產能能否跟上需求,超節點方案在實際訓練中的穩定性如何,這些都需要時間檢驗。
但至少有一點是確定的:當一個行業最頂尖的模型公司願意把自己最核心的工具鏈,成體系地移植到一個新的硬件平臺上,並且公開宣稱“性能接近硬件上限”的時候,這條路就不再只是一個備選方案了。
Related
相關文章

領導層洗牌後,Argon能否助谷歌重回前沿?
影子備忘錄2026.10.02 09:29 · 來自廣東全文5137字00:00 / 13:38谷歌AI的一場豪賭文 | 影子備忘錄2026年的AI賽道,用“瞬息萬變”來形容已經遠遠不夠。如果你每隔兩週沒有關注前沿模型的動態,打開排行榜時大概率會懷疑自己是不是錯過了整整一個季度。就在這樣近乎瘋狂的產品迭代節奏中,谷歌DeepMind於9月30日正式發佈了Gemini 4系列的首款旗艦模型Argon。距離上一代旗艦Gemini 3系列亮相,已經過去了將近十個月。

騰訊 WorkBuddy:Hy4 preview 夜間限免、Hy3 限免延期至 10 月 31 日
作者:沁滄(實習) 責編:沁滄 評論: 10 月 2 日消息,騰訊 WorkBuddy 於 9 月 30 日晚宣佈,決定將 Hy3 模型限免及 Hy4 preview 模型夜間限免均延期至 10 月 31 日。如果用戶已經體驗過 Hy4 preview —— WorkBuddy 在閒時夜間 (23:00 - 次日 8:00) 繼續提供免費體驗 Hy4 preview 的模型額度,截止 10 月 31 日,其餘時間正常消耗積分使用。
Cloudflare Releases Clef and Clef-flash: Open-Weight Decision Models That Return Typed Probabilities Instead of Text
Cloudflare has released Clef and Clef-flash, the first models trained by its Workers AI team. They are decision models, not chatbots. Each reads an input state and a schema of typed questions.

何愷明團隊新作:看貓片就能學會ARC挑戰
何愷明團隊提出NAT-ARC,一種純視覺的ARC解題方案,不依賴語言模型,而是使用ImageNet上的自然圖像進行MAE預訓練,再遷移到抽象格子推理任務。該方法在ARC-1上達到63.4%的單模型pass@2分數,集成後提升至70.2%,逼近專用LLM系統的表現,並證明了視覺預訓練能有效破解抽象推理的scaling瓶頸。

谷歌Gemini 4突然發佈!RSI加持,GPT和Opus都讓讓
。。。 假期第一天,谷歌攜Gemini 4 Argon空降多榜單第一。 拳打Opus 5.5,腳踢GPT-6 Astra。 更誇張的還在後頭,單項任務成本最低可至1.99美元,直接是Astra費用砍半。 最高百萬Token輸出上限,面向編程、金融和法律等複雜工作流,而且劃重點,網絡安全防禦能力超牛掰。 這波等等黨要贏麻了。 不過吧,咱普通用戶現在只可遠觀,暫時還吃不上。

階躍星辰“第一梯隊”,是“自嗨”嗎?
AIX財經2026.10.01 18:22 · 來自福建全文5252字00:00 / 15:27同行各自跑出了主線,階躍的“全棧”能跑通嗎?文 | AIX財經,作者|雷晶,編輯|魏佳沉寂許久的階躍星辰,正試圖擠進大模型第一梯隊。9月20日,它發佈Step 5 Preview,原生支持文本與視覺輸入,重點面向編程、軟件工程、專業知識工作和長程Agent任務。上線初期,登錄並完成首次調用後可獲得30天的Step Plan免費使用權。幾天後,Step Plan的月度套餐一度售罄。