103μs 降到 18μs 背後,Cursor 為何劍指英偉達,重寫 GPU?
NVIDIA 於七月二十一日公布了 GB300 NVL72 在訓練 DeepSeek-V3 模型時的最新成績,在僅使用 256 張 GPU 的配置下,單卡運算性能達到了 1,648 TFLOPS。這個數字不僅再次展示了 NVIDIA 在超大規模模型訓練領域的壓倒性實力,也讓外界看到其從晶片到互連技術的完整生態系優勢,依然難以撼動。然而,就在這份成績單公布的同時,一條截然不同的技術路線也悄悄浮上檯面。這項名為 MoK 的方案,試圖跳脫傳統 GPU 運算中「調度、通信、計算」各自獨立的框架,將 token 調度、跨 GPU 通信與專家計算全部整合進同一個 GPU 內核之中。
換句話說,它要從更底層的位置,重新改寫 GPU 的運作方式。MoK 的特殊之處,在於它不再把調度、通信與計算視為三個分離的環節,而是將它們融合為單一內核。這樣的設計思維,意味著資料在訓練過程中不需要反覆在 GPU 之間往返傳遞,邏輯判斷與數值運算可以在同一處完成,從而使整體流程變得遠比傳統架構更緊湊、更直接。在傳統的混合專家模型(MoE)訓練中,token 需要被動態分配給不同的專家網路,這個過程牽涉大量的路由器判斷,以及隨之而來的跨 GPU 資料搬移。當模型規模擴大到數千億甚至上兆參數時,這類通信開銷往往成為效能瓶頸,甚至比單純的矩陣運算更耗時。
MoK 的出現,正是為了從內核層級消滅這些不必要的來回浪費。這條路線與 NVIDIA 長期以來「堆疊算力」的思維形成了鮮明對比。NVIDIA 的優勢建立在頂尖的硬體設計與高速互連技術之上,透過 NVLink 等方案讓 GPU 之間的通訊不再是瓶頸;而 MoK 則不再依賴外部互連的提速,反而從系統設計端尋找破口,把原本必須分散處理的工作全部收攏進同一顆內核,從根本上改變運算的邏輯。值得注意的是,MoK 的整合式設計,反映出業界對 GPU 架構的一種另類思考:當硬體效能增長逐漸放緩,軟體層級與內核層級的重構,是否能夠成為突破下一個運算天花板的新鑰匙?
這並不是要取代 NVIDIA 的硬體路線,而是試圖在既有的 GPU 生態中,找到一條更高效的執行路徑。從實際成果來看,NVIDIA 依然以數字證明了自己在超大規模模型訓練上的優勢,GB300 NVL72 的成績單,足以讓任何競爭對手感到壓力。然而,MoK 的出現也提醒了市場,算力競賽的本質正在悄悄發生變化。過去,大家比的是誰的 GPU 更多、誰的時脈更高、誰的記憶體更大;現在,內核的設計方式、調度的效率、通信的減少,正在成為新的戰場。兩條路線的交鋒,表面上是一場技術選擇之爭,更深層來看,其實是整個 GPU 產業從「硬體軍備競賽」走向「架構重新想像」的轉折訊號。
NVIDIA 的成績固然亮眼,但 MoK 所代表的系統級創新,也絕非等閒之輩。當調度、通信與計算被放進同一顆內核的那一刻起,GPU 領域的競爭就不再只是算力數字的加減乘除,而是延伸到了更深層的內核設計與整體架構的重新定義。對開發者而言,這兩種路線各有可取之處。NVIDIA 提供的是穩定、成熟、經過大規模驗證的完整平台;MoK 則提供了一種可能性——即便在同樣的硬體上,只要重新設計內核邏輯,依然可以榨出更多的效能。這種「軟體重新定義硬體潛力」的思維,在未來 AI 模型持續膨脹的趨勢下,將扮演越來越重要的角色。目前,MoK 仍處於概念驗證與初步實作的階段,距離大規模商業化還有相當長的路要走。
但它的出現,已經為 GPU 領域開啟了一個新的討論方向:與其盲目追求更多的 GPU,不如問問自己,現有的 GPU 是否真的被用到了極致?在 NVIDIA 以驚人數字橫掃市場的同時,這些來自系統設計端的挑戰者,正在用另一種方式改寫遊戲規則。
Related
相關文章

AI芯片創業,又開始瘋狂了
AI芯片創業的熱潮,正以一種近乎狂熱的姿態重新席捲整個科技圈。從矽谷到北京,從初創團隊到資深半導體老兵,大量資金與人才正加速湧入這條賽道。與上一輪單純依賴資本催生的泡沫不同,這一波創業浪潮背後,有著更為堅實的產業邏輯與技術變革支撐,而算力需求的爆炸式增長,則是點燃這把火最直接的引信。 過去幾年,全球人工智能模型的參數量以指數級攀升,從十億級別迅速跨越到萬億級別。隨之而來的是,傳統通用GPU在處理特定AI任務時,開始暴露出功耗過高、成本昂貴以及算力利用率不足等瓶頸。

英偉達首次量化供需缺口,提前鎖定FY28+70%增長
英偉達在近期對外溝通中,首次以量化方式揭露了AI晶片市場的供需缺口,並以此為基礎,提前向外界定調了未來數年的營收成長預期。根據公司內部評估,目前市場對其加速運算產品的需求,已顯著超越供給能力,而這道缺口並非短期現象,而是會一路延伸至2028會計年度之後。英偉達高層明確表示,基於當前的訂單能見度與客戶端建置計畫,公司已能提前鎖定FY28(2028會計年度)至少70%的營收增長動能,這項數字也首度讓外界得以窺見其長期成長曲線的具體輪廓。

存力躍遷,AI破局,2026全球閃存峰會閃耀江城
2026全球閃存峰會在武漢登場,以「存力躍遷,AI破局」為主題,匯聚全球存儲產業專家,聚焦AI時代下存儲技術與產業變革。與會者認為,高頻寬、低延遲、大容量的存儲系統是支撐AI應用的關鍵,廠商也展示更高密度、更低功耗的閃存解決方案。峰會選在武漢舉辦,凸顯其作為中國存儲產業重鎮的地位,並釋出AI與存儲深度融合將成為半導體產業重要趨勢的訊號。

OpenAI自研芯片將擊穿英偉達CUDA護城河?
Kimi K2.5等主流第三方開源模型,表現同樣不輸GB200。報告還強調,OpenAI並未過度聚焦模型推理的某個特定部分,而是致力於打造一款能在所有場景下提供高性能的通用推理芯片。SemiAnalysis還認為,Jalapeño甚至不該與Blackwell“同臺競技”,而應該直接PK英偉達還未批量交付的Rubin。

亞馬遜 AWS 宣佈 2027~2028 年額外部署 200 萬塊 NVIDIA GPU
作者:溯波(實習) 責編:溯波 評論: 感謝網友 不一樣的體驗 的線索投遞!8 月 27 日消息,Amazon AWS(亞馬遜雲科技)在與 NVIDIA 的聯合新聞稿中宣佈,計劃在 2027~2028 年期間向其全球基礎設施額外部署 200 萬塊 NVIDIA GPU。

OpenAI 芯片實測跑分揭曉,「為模型造芯片」時代來了
OpenAI 自研芯片的實測跑分數據正式曝光,外界得以首次窺見這家 AI 巨頭在硬體領域的布局成果。這款備受矚目的晶片並非單純追求通用算力的極限,而是針對大型語言模型的推理與訓練特性進行深度調校,其性能表現也讓「為模型造芯片」的產業趨勢從概念走向現實。 從目前揭露的跑分結果來看,OpenAI 的晶片在特定 AI 工作負載下的表現相當突出,尤其是在處理長序列文本與複雜推理任務時,展現出優於傳統通用 GPU 的效率。