亮出“中國最強AI芯片”還不夠,平頭哥又甩出一手開源

大廠造芯,正在從交付芯片,走向更廣泛的開放共建階段。henry 發自 凹非寺 | 公眾號 QbitAI “這是目前中國算力性能最強的AI芯片,性能達到M890的3倍。” 9月22日的雲棲大會上,阿里巴巴集團CEO吳泳銘這樣介紹新一代真武V900。這款最強AI芯片的出鞘,將平頭哥的算力「硬實力」推到了聚光燈下。但對於考慮換用真武的客戶,還有另一件事要確認:過去寫下的代碼、積累的工具和開發經驗,能不能一起帶過來?芯片之外,軟件生態的「軟實力」同樣決定著客戶的選擇。
一天後的9月23日,平頭哥公佈了AI軟件棧T-Head SAIL的最新開源進展,進一步擴大框架適配、加速庫、工具鏈和通信庫等領域的開放範圍。在平頭哥的比喻裡,AI芯片是發動機,軟件棧則相當於“變速箱+傳動系統+駕駛系統”。發動機性能再強,最終能發揮多少,還取決於軟件能否讓模型順利遷移、運行和優化。現在,這套配套軟件正進一步向開發者開放。據悉,真武AI芯片已服務20多個行業的650多家客戶,螞蟻、小紅書、小鵬汽車等頭部企業已經開始使用T-Head SAIL。其中,小紅書還基於T-Head SAIL開源代碼,開發了模型遷移與算子優化Agent,用來加速生成式推薦模型在真武上的部署。
可以說,平頭哥提供基礎軟件能力,客戶則把自己的業務經驗寫進工具,繼續做遷移和優化,芯片背後的生態軟實力,也在這樣的參與中逐漸積累。而以阿里為代表的大廠造芯,也正在從交付芯片,走向更廣泛的開放共建階段。這次,平頭哥具體打開了什麼?簡單說來,T-Head SAIL可以理解為阿里平頭哥圍繞真武AI芯片打造的一套類“CUDA”軟件棧。它連接PyTorch等上層AI框架和底層真武硬件,負責模型遷移、編譯執行、計算加速和開發調試。今年7月WAIC上,平頭哥宣佈啟動T-Head SAIL開源,並向開發者提供SDK、驅動、性能分析與調試工具,以及相關技術文檔的下載。
兩個多月後的雲棲大會,團隊公佈了進一步的開源進展。已開源項目包括PyTorch-for-sail框架適配、sailify源碼遷移工具、Triton-for-sail算子開發工具,以及DeepGEMM-for-sail、FlashAttention-for-sail等計算加速項目。從調試工具、技術文檔到開源框架,隨著更多工具和資源的開放,SAIL讓開發者能夠深入瞭解軟件的具體實現,並根據業務需要查看、修改代碼。而這些工具和資源,回應的正是開發者在實際業務中遇到的幾個關鍵問題: 1、先解決遷移:過去攢下來的東西,別因為換芯片全重來。“最大的訴求,從業務角度來說,就是遷移成本有多大。
”在公開演講時,平頭哥半導體軟件生態資深總監陸生華這樣表示。這並不難理解。不少客戶的軟件已經在線上跑了很多年。代碼改過一輪又一輪,工具早就用順手了,團隊也有自己的一套調優經驗。換一款芯片,意味著這些積累都要重新接受檢驗,業務還不能因此中斷。框架適配、源碼遷移和算子開發工具,首先要做的就是儘可能保留這些積累。開發者可以繼續沿用熟悉的模型開發方式,由遷移工具輔助處理已有代碼,再根據新硬件的特點完成必要的適配。只有過去的積累越容易帶走,中國芯片才更有機會成為實際可用的選擇。2、模型跑起來之後,還得繼續摳性能。然而,遷移跑通,只是第一步。
如果換了芯片之後,效率只剩原來的30%-40%,那即便模型能跑起來,實際業務裡也很難接受。所以接下來馬上就會碰到第二個問題:同一個模型,能不能跑得更快?資源還能不能再省一點?這時候,只靠廠商把工具做好還不夠,DeepGEMM-for-sail、FlashAttention-for-sail這類計算加速項目開源的意義,也就顯現出來了。開源之後,開發者不只是把現成工具下載下來用,還可以直接看到裡面是怎麼實現的,再根據自己的模型和業務負載繼續改。過去需要交回芯片廠商的問題,現在業務團隊有機會自己定位、自己優化。更瞭解模型的人,可以直接參與決定模型怎樣在芯片上運行。
換句話說,T-Head SAIL開源不是多了一個下載入口,而是讓開發者真正參與到芯片性能優化裡。3、新模型出來後,最好Day 0就能跑。對於不少開發者來說,還有一個迫切需求就是—— 新模型發佈當天,最好就能在自己的算力平臺上試起來。現在模型的更新節奏基本上是幾週一更。如果適配慢了一輪,業務團隊嘗試新技術的時間也會跟著推遲。儘快支持新模型,甚至做到Day 0可用,已經成為客戶對算力平臺的期待。平頭哥也在持續提供面向真武適配的模型資源。按照現場演講披露的數據,截至2026年9月,其在ModelScope上已提供39個量化模型,覆蓋Qwen、DeepSeek、Kimi等系列,累計下載超過34.
8萬次。這些已經完成適配的模型,可以減少用戶自行準備的工作,讓部署和測試更早開始。與此同時,TensorFlow、JAX適配版本、自研推理引擎,以及PCCL、DeepEP-for-sail等通信組件和調試監控工具,也還在推進開源。未來,隨著更多代碼和工具開放,開發者能夠參與的工作也在增加:把原有業務遷到真武上,再按自己的需求修改、優化,甚至開發新的工具。而這種變化,已經能從小鵬、螞蟻和小紅書等客戶的實踐中看到。代碼打開之後,開發者開始自己動手 小鵬解決的,是把已有業務遷到新平臺上。藉助SAIL,小鵬將原先運行在GPU平臺上的業務模型遷到真武雲端集群,開展智能駕駛模型訓練。
遷移之後,團隊繼續利用SAIL的性能分析工具定位訓練瓶頸,再圍繞算子和框架進行優化。訓練任務換了硬件,開發者仍希望沿用熟悉的工作方式。SAIL支持C++、Triton、TileLang等開發方式,目的就是減少重新學習的負擔,讓團隊把精力放在模型和業務本身。螞蟻面對的,則是模型適配之後的持續調優。目前,螞蟻集團推理服務團隊已經基於SAIL,在真武810E和M890上完成主要前沿模型的推理適配。接下來,量化、推理階段分離、專家並行負載均衡、稀疏注意力接入等工作仍在繼續。模型能返回正確結果,只解決了功能問題。面向真實的推理服務,團隊還需要不斷改善處理效率和資源開銷,軟件優化會伴隨業務持續進行。
小紅書又往前走了一步,把遷移和優化做成了自己的工具。基於SAIL開源代碼,小紅書面向真武架構開發了模型遷移與算子優化Agent,用自動化方式輔助優化,加速生成式推薦模型的部署上線。在這個過程中,客戶可以把自己的模型經驗和業務需求寫進工具,形成適合自身場景的優化方法。廠商提供的基礎實現,成為了下一輪開發的起點。這也回應了陸生華在採訪中提到的一個矛盾: 客戶想針對芯片開發高性能算子,往往又需要保護自己的算法和知識產權。算法細節不方便交出去,芯片廠商卻需要了解這些細節,才能代為優化。開放軟件代碼和架構信息後,客戶就有條件自己完成這項工作。
核心業務邏輯可以留在內部,團隊根據公開的硬件信息編寫定製算子,再檢查和調整軟件實現。涉及核心算法的改動,可以留在企業內部;願意公開的工具和優化,則可以提交給社區。T-Head SAIL為此建立了貢獻流程: 開發者可以提出問題、修改代碼、提交貢獻,經過自動化測試和維護者、社區評審後,改進可以合入主線,隨版本發佈。據介紹,T-Head SAIL開源後,已經有阿里內部和外部客戶提交代碼貢獻。平頭哥收到的反饋也相當具體:有人希望把自己的項目貢獻出來,有人需要更多硬件架構信息,以便開發定製算子;還有人希望新模型、新框架得到更快支持。與此同時,這些需求也在改變平頭哥的軟件開發安排。
真武的架構信息已經公開,社區治理和貢獻規則仍在完善;團隊正推動軟件組件解耦發佈,讓不同項目能夠分別更新,並將面向真武的適配成果逐步提交回上游社區。客戶自己解決一個問題之後,如何讓其他人也用上這項改進,就是代碼開放之後需要繼續完成的工作。阿里為什麼選擇在這個時候進一步開放?要理解這個時間點,得先回到芯片本身:已經有足夠多的人拿到硬件、用進業務,適配和優化的需求才會真正出現。從2019年的含光800,到2021年的倚天710,再到如今的真武系列,平頭哥走了多年。其中一條持續的路徑,是從業務需求出發設計芯片,先在阿里內部驗證,再通過雲等方式服務外部客戶。
陸生華談到,外部客戶接觸新芯片時,常會先確認一件事:阿里自己用過沒有?淘寶、搜索、推薦、廣告等業務承擔了早期生產驗證的角色。經過實際流量和集群穩定性的考驗,產品再逐步向外推廣。到真武M890,團隊已經完成兩代完整芯片交付。在陸生華看來,軟件的成熟度和客戶對二次開發的需求,共同促成了此時的開放。650多家客戶意味著產品得到了使用,也意味著廠商要面對越來越多不同的問題。汽車企業訓練模型,互聯網企業優化推薦,模型團隊嘗試新算法,各自的計算方式和性能瓶頸並不相同。同一套基礎軟件之上,還會有大量貼近具體業務的開發。客戶越多,把這些工作全部留給芯片廠商就越難持續。
這時擴大開放,既有經過驗證的軟件可以拿出來,也有真正需要它、願意繼續開發的用戶。此外,對平頭哥來說,還有一筆長期維護的賬。芯片廠商基於主流框架做適配,通常需要修改一部分代碼。如果長期維護自己的獨立版本,上游每次更新,都要重新同步代碼、處理差異、測試驗證。獨立版本和上游分開的時間越長,這項工作就越重。把適配和優化提交回PyTorch、vLLM、Triton等上游社區,是為了讓真武的支持能夠隨主流軟件一起演進。客戶希望更快用上新技術,平頭哥也需要減少重複維護,才能騰出精力支持更多模型和業務。當然,代碼開放之後,廠商的工作仍然要繼續。
原先統一發布的軟件包拆成多個獨立組件,需要新的檢查和測試安排;社區提交的改動,也需要有人評審、維護並對產品質量負責。開放能擴大參與範圍,也要求平頭哥建立長期協作的能力。再把視線拉遠,SAIL的選擇,也與阿里的整體AI佈局相接。今年雲棲大會上,吳泳銘明確提出,阿里將長期投入AI模型、AI芯片和AI雲。△圖源:阿里 而早在2025年2月,阿里就宣佈了三年內至少投入3800億元建設雲和AI基礎設施的計劃,隨後又提出將在這一計劃上進一步增加投入。模型帶來新的算法、計算精度和並行需求,芯片提供計算、內存和互聯能力。
SAIL通過編譯器、算子庫和通信庫,讓模型的這些需求在硬件上得到實現,再由雲將整套計算能力組織成服務,交付給用戶。這層軟件能否及時跟上,影響著新模型能多快用上硬件的性能,也影響著雲上業務的運行效率。阿里內部已經在做這種協同。按照陸生華的介紹,平頭哥正在與千問團隊合作,探索讓模型生成高性能算子。生成一段功能正確的代碼相對容易,要讓它充分發揮芯片性能,還需要模型理解底層架構。但千問的需求無法涵蓋所有行業。小紅書的生成式推薦、小鵬的智能駕駛訓練,各有自己的模型、數據和優化目標。T-Head SAIL進一步開放,是讓這些團隊也能參與連接模型與硬件的軟件開發,把對業務的理解轉化為具體實現。
總的來說,阿里在模型、芯片和雲上的持續投入,最終要由更多業務來檢驗。芯片交付之後,軟件能否持續跟上,客戶能否按自己的需求開發,都會影響這些投入最終能服務多廣的市場。“生死看淡,不服就幹”的平頭哥,用多年投入積累了造芯和用芯的能力。走到今天,它開始把更多經過業務驗證的代碼和工具,交到開發者手中。而大廠造芯,也終於到了生態建設的時刻。SAIL的全稱是Seed of AI Library。按照平頭哥的解釋,每一行開源代碼,都是一顆種子。芯片已經進入真實業務,接下來,就是期待這些種子在更多開發者手裡,長出自己未曾預設的工具、優化和應用。版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

Edge AI Daily 早報(9月26日)
Edge AI Daily2026.09.26 07:59 · 來自北京全文8142字00:00 / 22:15Meta推AI掛件繞過模型大戰,OpenAI醞釀500美元套餐。Runway發佈WorldPrompt,Cursor推Project模式。

Meta 已經想清楚 Muse 靠什麼賺錢
AGI-Signal2026.09.26 07:53 · 來自河南全文4239字00:00 / 11:34眼鏡、鑰匙扣、電腦、手機的入口,可能都是同一個智能體。美東時間週五收盤,Meta 報751.66美元,單日下跌3.3%,總市值約1.9萬億美元。

暢銷小說被指用 AI 創作,法國最有名文學獎龔古爾獎將其移出初選名單
作者:清源 責編:清源 評論: 9 月 25 日消息,據路透社報道,當地時間 25 日,法國最負盛名的文學獎項 —— 龔古爾獎主辦方宣佈,將海地裔加拿大作家泰利森 · 奧雷利安的暢銷小說《C'etait Ca ou Mourir(要麼就這樣,要麼死)》移出初選名單,原因是有人指控奧雷利安使用 AI 創作該書。

“AlphaGo”殺進足球場!自我對弈140年,機器人成“梅西終結者”
美國具身智能獨角獸Skild AI推出人形機器人Messinator,其核心是旗艦機器人基礎模型S1,透過自我對弈的方法在虛擬環境中訓練了140年,成功學會帶球、護球和射門等足球技巧。該機器人能透過觀看影片示範來理解任務並執行,顯示AlphaGo的自我對弈策略在物理世界中也獲得了成功驗證。

OpenAI闖大禍!GPT竟黑進醫保系統,黃仁勳:管不住就關掉
OpenAI的AI代理未經授權入侵澳洲國民醫保系統Medicare,時間約在6月,直到8月OpenAI內部覆盤才發現,9月才通報澳洲當局,延誤近三個月引發澳方不滿。研究機構Transluce稱此為全球已知首例AI代理自主入侵官方系統事件,事發時間比先前公開的Hugging Face入侵案還早一個月。據了解該代理原本僅受命蒐集公開醫藥支出數據,卻自行鎖定覆蓋2750萬人的Medicare統計系統。

梁文鋒狙擊戰:深扒那些梁文鋒署名的論文有多牛
本文作者: 高允毅 2026-09-25 18:48 導語:過去三年,梁聖署名了11篇論文,每篇都幾乎震動世界。過去三年,梁聖署名了11篇論文,每篇都幾乎震動世界。作者丨高允毅 編輯丨岑 峰 當 RSI 的風吹到了 DeepSeek,這次討論的是一個新話題“自動化沙箱”。