一份CUDA源碼,跑上了蘋果GPU

2026年7月23日 15:36
一份CUDA源碼,跑上了蘋果GPU

重點摘要

一段原本為英偉達 CUDA 設計的計算程序,幾乎無需修改內核代碼,成功在搭載 M3 Pro 的蘋果設備上執行,並在三維流體模擬中實現約 10 倍速度提升。開發者透過 Clang/HIP、SPIR-V、Vulkan 及 MoltenVK 等多層轉換通道,讓蘋果 Metal GPU 得以高效運行 CUDA 源碼,過程中還獲得 GPT-5 的輔助。

站內 AI 整理稿

一段原本為 NVIDIA CUDA 設計的計算程式,幾乎不需要修改核心程式碼,就直接在搭載 M3 Pro 晶片的蘋果設備上順利執行。這項突破是由 X 平台用戶 @Abhinav 於昨日公開的進展,迅速引發開發者社群的高度關注。更令人驚豔的是,這並非只是簡單的「向量加減乘除」這類基礎運算展示,而是在真實的三維流體模擬任務中,實現了約 10 倍的速度提升。這項成果不僅證明了跨平台 GPU 運算的可行性,也為長期以來被 NVIDIA CUDA 生態主導的高效能計算領域,帶來全新的想像空間。這項突破背後,有一個特殊的參與者——GPT-5。

整個實驗發生在開源科學計算平台 OpenFPM 上,研究人員長期以來一直在嘗試一件許多人認為「不太可能」的事情:讓原本專為 CUDA 或 HIP GPU 設計的高效能計算程式,跨越平台壁壘,順利運行到蘋果自家的 Metal GPU 架構上。過去十幾年來,GPU 運算領域一直處於高度碎片化的狀態。NVIDIA 有 CUDA,AMD 有 HIP,蘋果則有 Metal。一個用 CUDA 寫成的程式,通常需要耗費大量人力與時間重新改寫,才能在其他平台上執行。這不僅增加了開發成本,也限制了科學計算與機器學習領域的跨平台協作。

然而,這次開發者並沒有選擇重新開發一套 Metal 版本,而是巧妙地搭建了一條轉換通道。整個流程大致是:程式先經過 Clang 與 HIP 的處理,再透過 SPIR-V、Vulkan 以及 MoltenVK 等中間層進行轉譯,最終讓蘋果的 Metal GPU 能夠理解並高效執行這些原本為 CUDA 設計的指令。這條轉換通道的關鍵在於,它幾乎不需要修改原始 CUDA 程式碼的核心邏輯。研究人員表示,他們僅針對極少數與平台相關的細節進行調整,絕大多數的內核程式碼都維持原樣。這意味著,過去需要耗費數月甚至數年才能完成的跨平台移植工作,如今可能大幅縮短。

值得注意的是,GPT-5 在這次實驗中扮演了輔助角色。研究人員利用 GPT-5 協助分析與優化轉換過程中的程式碼相容性問題,並針對 Metal GPU 的架構特性提出建議。雖然 GPT-5 並非直接參與編譯或執行,但其在程式碼理解與建議生成方面的能力,確實加速了整個驗證流程。三維流體模擬是一項對運算資源要求極高的任務,通常需要大量平行運算能力。過去,這類模擬幾乎只能在配備 NVIDIA GPU 的系統上高效執行,因為 CUDA 生態提供了成熟的函式庫與最佳化工具。如今,蘋果的 M3 Pro 晶片也能在幾乎不修改程式碼的情況下,展現出約 10 倍的速度提升,這對科學計算社群來說無疑是一劑強心針。

這項成果也引發了關於 GPU 運算生態未來走向的討論。長期以來,NVIDIA 憑藉 CUDA 建立了強大的護城河,許多高效能計算應用都深度依賴其生態系統。然而,隨著蘋果、AMD 等競爭對手持續強化自家 GPU 架構,以及開源社群不斷開發跨平台轉換工具,CUDA 的獨佔地位正面臨挑戰。OpenFPM 平台本身是一個專注於高效能科學計算的開源框架,目標是讓研究人員能夠更輕鬆地編寫與部署平行運算程式。這次成功將 CUDA 程式碼跑上蘋果 GPU,不僅驗證了 OpenFPM 的跨平台設計理念,也為未來更多科學計算應用在蘋果生態系統中落地鋪平了道路。

目前,這項技術仍處於早期驗證階段,距離大規模商業應用還有一段距離。研究人員表示,他們將持續最佳化轉換通道的效能,並探索更多類型的 CUDA 程式能否順利移植。同時,他們也呼籲更多開發者加入測試與貢獻,共同推動 GPU 運算的跨平台標準化。對於一般使用者來說,這項進展最直接的影響可能是:未來在 Mac 電腦上執行高效能計算或機器學習任務時,將不再需要依賴 NVIDIA 的硬體。蘋果的 M 系列晶片本身具備強大的 GPU 效能,若能搭配成熟的跨平台運算框架,將大幅提升 Mac 在科學計算領域的競爭力。整體而言,這項實驗不僅展示了技術上的可能性,也反映了開源社群與大型語言模型協作的新模式。

GPT-5 的參與雖然並非主導,卻凸顯了 AI 輔助開發在解決複雜系統相容性問題上的潛力。隨著這類工具持續演進,未來跨平台 GPU 運算的門檻可望進一步降低。

Related

相關文章

AIBaseAI硬體

OpenAI 首款硬件真容浮現:冰球大小無屏設計,售價 300 至 400 美元

OpenAI首款硬件產品細節曝光,為一款無螢幕的智能音箱,外型類似冰球,售價約300至400美元,由OpenAI與前蘋果設計師Jony Ive的LoveFrom公司合作開發。該設備內建電池與攝影鏡頭,可支援手持使用並將視覺資訊傳給ChatGPT,實現多模態感知。此產品推出時正值蘋果對OpenAI提起商業機密訴訟,OpenAI內部評估其設計細節有望反駁侵權指控。

19 小時前4700
雷峰網AI硬體

金剛GC3芯片重新定義視頻AI算力規則,國產RISC-V高端算力商業化提速

近日,第三屆中國計算機學會芯片大會(CCF Chip 2026)在太湖之濱無錫成功舉辦。會場中,兩院院士與頂尖工程師們的討論話題直指底層架構的“根技術”創新。一個核心追問被反覆推至臺前:當摩爾定律逼近物理極限,製程紅利日益稀薄,堆核心、拼頻率的老路越走越窄,是否該徹底換一條路走?換言之,與其在通用架構上不斷打補丁,能否從數據流動的本質出發,為特定場景原生設計一顆芯片?

1 天前
雷峰網AI硬體

把512 GiB閃存搬到xPU旁邊,HBF能打破推理內存牆?

HBM已經證明,通過堆疊和共封裝把存儲介質遷移至GPU附近,可以緩解AI計算中的數據搬運瓶頸。現在,SK海力士聯合閃迪,將類似的思路正式應用到NAND上,通過HBF將大容量閃存放到包括GPU在內的各類xPU旁,以緩解AI推理內存牆問題。近日,雙方通過OCP發佈《High Bandwidth Flash(HBF)High-Level Base Die Specification, Version 0.7.0》。

1 天前
鈦媒體AI硬體

AI的錢,被誰賺走了?

AI 浪潮推動雲端服務供應商大舉擴建資料中心,背後龐大的資本支出正沿著供應鏈層層傳導,最終流向光模塊、晶片與伺服器業者。這條資金鏈路的起點是亞馬遜 AWS、微軟 Azure、Google Cloud 等雲端廠商,他們為了滿足訓練與推論大語言模型所需的算力,持續加碼採購 GPU 伺服器與高速網路設備,帶動上游零組件需求爆發。

2 天前