16張B200才能跑的Kimi K3,8張AMD就裝下了

重點摘要
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。
一款擁有2.8萬億參數的超大規模語言模型,原本需要16張NVIDIA B200 GPU、橫跨兩台伺服器才能運行,如今卻被8張AMD MI355X在一台伺服器內輕鬆裝下。這項由AI部署方案商Wafer AI完成的實測結果,不僅展示了AMD硬體在超大模型推理上的潛力,也讓「顯存容量比算力更重要」的觀點再次浮上檯面。 Wafer AI近期在AMD MI355X加速卡上成功部署了Kimi K3模型。該模型權重超過1TB,僅參數量就達到2.8萬億,過去要運行這樣的鉅型模型,業界通常依賴NVIDIA的旗艦級B200 GPU,且需要16張卡、兩台8卡伺服器才能完成部署。然而,Wafer AI僅用一台搭載8張MI355X的AMD伺服器,就將整個模型完整載入並順利運作。 在實際性能測試中,Wafer AI設定輸入1024個Token、輸出400個Token的典型場景。結果顯示,8張MI355X的總吞吐量達到每秒952個Token,單用戶生成速度為每秒118個Token。若以單節點(一台伺服器)計算,這套AMD方案的吞吐量約為16卡B200方案的3.8倍。更令人矚目的是,Wafer AI進一步指出,MI355X方案在性價比上也超越了NVIDIA的B200與後續的B300,顯示AMD在超大規模模型推理領域已具備不容忽視的競爭力。 最讓開發者感到意外的,或許是AMD軟體生態ROCm的表現。過去AMD在AI部署上常因驅動與軟體工具鏈不夠成熟而受到詬病,但這次Wafer AI團隊表示,在MI355X上部署Kimi K3的過程中,「ROCm居然沒有特別折騰」。這意味著AMD近年來在軟體層面的持續投入開始顯現成果,讓開發者能夠更順暢地將超大模型遷移到其硬體平台上。 Kimi K3之所以需要如此龐大的顯存,關鍵在於其2.8萬億的參數量。僅模型權重一項就超過1TB,這還不包括推理過程中所需的KV Cache等暫存空間。在傳統GPU上,模型參數必須全部載入顯存才能進行推理,因此顯存容量直接決定了能否部署單個巨型模型,或是能否在單節點內完成部署。過去,即便NVIDIA B200擁有192GB的HBM3e顯存,但要容納Kimi K3仍需要16張卡,且必須跨伺服器連接,增加了通信延遲與部署複雜度。 AMD MI355X的顯存規格雖然尚未完全公開,但從8張卡即可裝下Kimi K3來看,其單卡顯存容量可能遠超B200,或者採用更高效的記憶體壓縮技術。Wafer AI的測試結果也顯示,在超大模型場景下,顯存容量已成為比算力(FLOPs)更關鍵的瓶頸——只要有足夠的顯存,就能在單節點內減少跨節點通信,從而獲得更高的有效吞吐量。 這項實測對AI基礎設施的採購決策可能產生深遠影響。過去,企業在選擇AI伺服器時,往往優先考慮NVIDIA的CUDA生態與峰值算力。但隨著模型參數規模持續膨脹,尤其是像Kimi K3這類接近3萬億參數的模型,顯存容量與單節點部署能力開始成為更實際的衡量標準。AMD MI355X方案能以更少的卡數、更低的伺服器數量完成同等規模的推理任務,並且在吞吐量與性價比上雙雙勝出,可能吸引更多AI公司重新評估AMD硬體。 值得注意的是,Wafer AI的測試場景僅限於特定輸入輸出長度,實際生產環境中的性能表現可能因模型架構、批次大小、並行策略等因素而有所差異。但無論如何,這次實測打破了「只有NVIDIA能跑超大模型」的既有印象,也為AMD在AI加速器市場的後續發展注入一劑強心針。 業界分析認為,隨著AI模型持續邁向萬億參數級別,分散式推理的通信開銷將愈發可觀,單節點內能容納更多參數的硬體方案將具備明顯優勢。AMD若能在後續的MI400系列中進一步提升顯存容量與頻寬,同時繼續優化ROCm工具鏈,有望在超大規模模型推理領域與NVIDIA形成更直接的競爭態勢。而Wafer AI這項部署案例,無疑為AMD的技術路線提供了有力的實戰背書。
Related
相關文章

自研高性能分佈式解決方案,「芯曉科技」將芯片電源籤核週期從幾周縮短至幾天 | 水下項目
這篇消息聚焦「自研高性能分佈式解決方案,「芯曉科技」將芯片電源籤核週期從幾周縮短至幾天 | 水下項目」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

訊飛 AI 眼鏡圖賞:輕盈舒適,凝練商務風
首頁 > 智能時代>智能穿戴 訊飛 AI 眼鏡圖賞:輕盈舒適,凝練商務風 2026/8/3 17:01:29 來源:IT之家 作者:汐元 責編:汐元 評論: 今年 5 月,科大訊飛在澳門 BEYOND Expo 2026 上正式發佈了訊飛 AI 眼鏡。這也是科大訊飛的首款 AI 眼鏡,定位為眼前的超級 AI 助理。我們知道科大訊飛在以翻譯為核心的教育、辦公領域一直是強項,這次 AI 眼鏡也是著重主打這個場景。

“榨”出硅的極限:怎麼讓GPU不“閒著”?
GPU運算能力雖持續提升,但常因記憶體頻寬、資料傳輸延遲及模型設計限制導致運算單元閒置。軟體端透過改良模型平行化與動態排程,硬體端則依賴更高頻寬記憶體與異質卸載,共同目標是從系統整合層面榨出更多有效算力,避免晶片浪費。
首家國產自研GPU廠商登陸ChinaJoy,礪算LX 7G100消費顯卡零售版全面開售
這篇消息聚焦「首家國產自研GPU廠商登陸ChinaJoy,礪算LX 7G100消費顯卡零售版全面開售」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
ANE探索蘋果本機訓練
ANE探索蘋果本機訓練。 項目借私有接口訓練神經引擎。端側模型開發多出一條新路。蘋果神經引擎項目累計7.1k。當天新增⚙️22星關注。逆向接口仍存在兼容性風險。
GPU管理:為何閒置GPU如同停飛的飛機
回到文章 GPU管理:為何閒置GPU如同停飛的飛機 團隊文章 發表於2026年7月30日 讚 - Erick Lachmann ErickvL 追蹤 Dharma-AI Gabriel Pimenta de Freitas Cardoso GabrielPimenta99 追蹤 Dharma-AI Gustavo Lucchetti gustavolucchetti 追蹤 Dharma-AI 利用率,而非智慧,才是AI下一個真正的限制。航空業曾付出慘痛代價才學到這點。