CUDA 20年護城河一個週末崩了,Claude獨自跑通AMD新GPU

重點摘要
英偉達CUDA歷經20年打造的軟體生態,竟在一個週末之內被AI跨越。Anthropic旗下模型Claude在完全無人干預的情況下,自行完成對AMD最新GPU MI355X的適配與性能調校,整個過程僅由一名工程師下達指令,人類團隊全程未修改任何一行程式碼。 故事始於AMD向Anthropic提供一台搭載MI355X的測試機架。團隊原本預期需要投入大量人力進行新平台與新軟體堆疊的適配工作,但他們決定讓Claude嘗試直接接手。一名工程師將Claude連接至機器,簡單指示「去把這台機器跑起來」,便結束工作。
英偉達CUDA歷經20年打造的軟體生態,竟在一個週末之內被AI跨越。Anthropic旗下模型Claude在完全無人干預的情況下,自行完成對AMD最新GPU MI355X的適配與性能調校,整個過程僅由一名工程師下達指令,人類團隊全程未修改任何一行程式碼。故事始於AMD向Anthropic提供一台搭載MI355X的測試機架。團隊原本預期需要投入大量人力進行新平台與新軟體堆疊的適配工作,但他們決定讓Claude嘗試直接接手。一名工程師將Claude連接至機器,簡單指示「去把這台機器跑起來」,便結束工作。
週末過後,螢幕上出現一條持續上升的性能曲線,Claude不僅成功啟動系統,還自動反覆迭代優化,性能不斷提升。Anthropic聯合創辦人兼首席計算官Tom Brown在公開場合分享此事後,AMD董事長暨執行長蘇姿豐隨即回應。她表示,得知Anthropic僅派一名工程師處理MI355X時,第一反應是讓AMD團隊前往支援,但對方回覆說不需要,已經全部完成。這項週末實驗很快轉為正式部署計畫,Anthropic近日宣布將在AMD Helios系統中部署最高2GW的Instinct GPU,首批1GW預計於2027年上半年啟動,雙方還將直接使用Claude優化AMD工作負載,加速ROCm軟體開發。
Claude之所以能對CUDA生態形成「降維打擊」,關鍵在於AMD直接為AI開發了一套可自主操作GPU的工具。在AMD Advancing AI 2026大會上發表的ROCm.AI,正是為Claude、Codex、Cursor等AI代理準備的完整GPU工具箱。入口名為AMD Skills,內含經過驗證的ROCm知識,代理取得這些知識後,能自行安裝環境、部署模型、讀取日誌、排查故障,並透過ROCm CLI調用真實機器。開發者只需說出目標,後續路徑由AI自主尋找。AMD甚至改變了晶片說明書的寫法。
該公司AI軟體與解決方案副總裁Anush Elangovan透露,每一代AMD GPU都會公開指令集,並提供AI可讀的ISA。代理在讀懂手冊後,便能直接著手調校性能。這部分工作交由Hyperloom工具執行,它會拉起推理服務,先跑出基線,再逐一找出CPU與GPU瓶頸,測試不同配置,生成客製化內核,最後將新方案重新執行。現場演示中,Hyperloom讓MiniMax M3的輸出速度提升38%,AMD還讓它一次跑完1.4萬個模型,將測試結果沉澱為可重複使用的經驗。AMD正與前沿模型公司合作訓練這種能力,目標是讓前沿模型「天生就會說AMD程式語言」。
未來評估一顆晶片時,除了峰值算力與記憶體頻寬,AI能否讀懂、調用、並將性能調校出來,也將成為同等重要的規格。晶片公司要爭取的開發者,從此多了一類:AI代理。CUDA從2006年發展至今,靠的是無數工程師一行行程式碼堆疊出的生態系統,包含編譯器、數學庫、調試器、性能分析工具、開發文檔,應有盡有。更難複製的是工程師們長年累積的實戰手感:算子如何調整、通訊如何加速、記憶體如何分配、分散式部署最容易出錯的地方在哪裡,這些經驗全鎖在少數專家腦中。後來者即使造出性能接近的硬體,也得從頭走完整條軟體長路;晶片流片可以按季度推進,生態積累卻只能以年為單位煎熬。AI代理補足的正是這一段。
它會讀取平台文檔、調用性能分析工具、找出速度瓶頸,再修改程式碼、編譯、測試。方案無效就換下一種;跑分變好就沿此方向繼續優化。人類培養一名頂級GPU工程師需要按年計算,而多啟動一個代理只需再開一個任務。一名工程師派出多個代理,就能並行排查報錯、定位性能瓶頸;一次跑通的配置、寫好的內核與踩過的坑,也能立即成為下一批代理的起點。將按年計算的追趕壓縮成按任務計算,正是AI最核心的價值所在,也是ASI層級能力對CUDA生態的降維打擊。目前中國工程師已站在這場AI改造GPU軟體棧的最前線,他們沉澱下來的底層經驗,正被整理成更多代理可調用的能力。
追趕CUDA的新起點已經出現:把硬體介面與軟體工具交給AI,讓代理直接開工。20年的生態差距,第一次可以交給一群代理晝夜不停地往回追趕。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。