103μs 降到 18μs 背後,Cursor 為何劍指英偉達,重寫 GPU?
七月二十一日,NVIDIA 公布 GB300 NVL72 訓練 DeepSeek-V3 的最新成績:在 256 張 GPU 上,單卡性能達到 1,648 TFLOPS。這個數字再次展現 NVIDIA 在超大規模模型訓練上的壓倒性實力。與此同時,另一條技術路線也引起關注——名為 MoK 的方案,嘗試把 token 調度、跨 GPU 通信與專家計算全部放進同一個 GPU 內核,從更底層的位置重寫運作方式。MoK 的特殊之處,在於它不再把調度、通信與計算視為三個獨立環節,而是整合進單一內核。這意味著資料不必在 GPU 之間反覆傳遞,邏輯與計算可以在同一處完成,整體流程也因此更緊湊。
相較於純粹堆疊 GPU 數量,這種路線更重視內核層級的效率重構,也被視為對 NVIDIA 現有架構的一種另類回應。NVIDIA 用實際成績證明其在硬體與互連技術上的優勢;MoK 則試圖從系統設計端尋找破口。兩者交鋒之下,GPU 領域的競爭已經不再只是算力數字競賽,更延伸到內核、調度與整體架構的重新想像。
Related
相關文章

AI芯片創業,又開始瘋狂了
AI芯片創業的熱潮,正以一種近乎狂熱的姿態重新席捲整個科技圈。從矽谷到北京,從初創團隊到資深半導體老兵,大量資金與人才正加速湧入這條賽道。與上一輪單純依賴資本催生的泡沫不同,這一波創業浪潮背後,有著更為堅實的產業邏輯與技術變革支撐,而算力需求的爆炸式增長,則是點燃這把火最直接的引信。 過去幾年,全球人工智能模型的參數量以指數級攀升,從十億級別迅速跨越到萬億級別。隨之而來的是,傳統通用GPU在處理特定AI任務時,開始暴露出功耗過高、成本昂貴以及算力利用率不足等瓶頸。

英偉達首次量化供需缺口,提前鎖定FY28+70%增長
英偉達在近期對外溝通中,首次以量化方式揭露了AI晶片市場的供需缺口,並以此為基礎,提前向外界定調了未來數年的營收成長預期。根據公司內部評估,目前市場對其加速運算產品的需求,已顯著超越供給能力,而這道缺口並非短期現象,而是會一路延伸至2028會計年度之後。英偉達高層明確表示,基於當前的訂單能見度與客戶端建置計畫,公司已能提前鎖定FY28(2028會計年度)至少70%的營收增長動能,這項數字也首度讓外界得以窺見其長期成長曲線的具體輪廓。

存力躍遷,AI破局,2026全球閃存峰會閃耀江城
2026全球閃存峰會在武漢登場,以「存力躍遷,AI破局」為主題,匯聚全球存儲產業專家,聚焦AI時代下存儲技術與產業變革。與會者認為,高頻寬、低延遲、大容量的存儲系統是支撐AI應用的關鍵,廠商也展示更高密度、更低功耗的閃存解決方案。峰會選在武漢舉辦,凸顯其作為中國存儲產業重鎮的地位,並釋出AI與存儲深度融合將成為半導體產業重要趨勢的訊號。

OpenAI自研芯片將擊穿英偉達CUDA護城河?
Kimi K2.5等主流第三方開源模型,表現同樣不輸GB200。報告還強調,OpenAI並未過度聚焦模型推理的某個特定部分,而是致力於打造一款能在所有場景下提供高性能的通用推理芯片。SemiAnalysis還認為,Jalapeño甚至不該與Blackwell“同臺競技”,而應該直接PK英偉達還未批量交付的Rubin。

亞馬遜 AWS 宣佈 2027~2028 年額外部署 200 萬塊 NVIDIA GPU
作者:溯波(實習) 責編:溯波 評論: 感謝網友 不一樣的體驗 的線索投遞!8 月 27 日消息,Amazon AWS(亞馬遜雲科技)在與 NVIDIA 的聯合新聞稿中宣佈,計劃在 2027~2028 年期間向其全球基礎設施額外部署 200 萬塊 NVIDIA GPU。

OpenAI 芯片實測跑分揭曉,「為模型造芯片」時代來了
OpenAI 自研芯片的實測跑分數據正式曝光,外界得以首次窺見這家 AI 巨頭在硬體領域的布局成果。這款備受矚目的晶片並非單純追求通用算力的極限,而是針對大型語言模型的推理與訓練特性進行深度調校,其性能表現也讓「為模型造芯片」的產業趨勢從概念走向現實。 從目前揭露的跑分結果來看,OpenAI 的晶片在特定 AI 工作負載下的表現相當突出,尤其是在處理長序列文本與複雜推理任務時,展現出優於傳統通用 GPU 的效率。