Fable 5手搓首個CUDA「超級內核」,2.5小時狂飆18.7倍

2026年7月7日 15:30
Fable 5手搓首個CUDA「超級內核」,2.5小時狂飆18.7倍

重點摘要

人工智慧模型自我進化的新里程碑悄悄浮現。近日,AI 模型 Fable 5 在 GPU 算子基準測試 KernelBench-Mega 中,以「純手搓」CUDA 核心程式碼的方式,在短短 2.5 小時內將效能推升 18.7 倍,不僅大幅超越所有競爭對手,更讓業界領袖驚呼「遞迴自我改進(RSI)已經開始」。

站內 AI 整理稿

人工智慧模型自我進化的新里程碑悄悄浮現。近日,AI 模型 Fable 5 在 GPU 算子基準測試 KernelBench-Mega 中,以「純手搓」CUDA 核心程式碼的方式,在短短 2.5 小時內將效能推升 18.7 倍,不僅大幅超越所有競爭對手,更讓業界領袖驚呼「遞迴自我改進(RSI)已經開始」。這項成果凸顯了大型語言模型不僅能理解、生成文字,更能直接深入硬體層級,從底層最佳化 GPU 運算潛力。KernelBench-Mega 是專為 GPU 運算核心(Kernel)設計的評測基準,要求參賽模型針對特定數學運算寫出對應的 CUDA 程式碼,並以執行速度作為主要評分標準。

CUDA 是 NVIDIA 推出的平行運算架構,長期以來被視為高效能運算的關鍵技術,最佳化 CUDA 內核需要同時掌握硬體架構、記憶體管理、執行緒調度等專業知識,過去多半仰賴資深工程師手動調整。Fable 5 在這次測試中,完全沒有仰賴任何預先編寫的模板或輔助工具,而是從零開始「手搓」出一個效能突破性的超級內核。測試平台採用的是 NVIDIA RTX PRO 6000 專業繪圖卡,這款 GPU 具備強大的運算單元與高速記憶體,但能否發揮極限效能仍取決於程式碼品質。Fable 5 在 2.5 小時內生成的最佳化 CUDA 內核,對比基線版本達到 18.

7 倍的加速比,這意味著原本需要執行近 19 小時的運算任務,現在可在 1 小時內完成。相比之下,同樣在榜單上名列前茅的 Claude Opus 4.5 雖然也展現了優異的 CUDA 編寫能力,但最終成績被 Fable 5 甩開了整整四倍以上的差距,形成「斷層式」領先。值得注意的是,這並非單純的模型能力比較,而是 AI 開始展現「自我進化」潛力的具體徵兆。Anthropic 聯合創始人 Jack Clark 在社交平台上直接評論此事,指出 Fable 5 的表現標誌著「RSI(遞迴自我改進)自我進化開始了」。

他認為,當 AI 能夠自主改寫底層運算程式碼,並在硬體層面實現效能飛躍時,代表模型已經具備某種程度的自我最佳化能力——這種能力過去被認為是通用人工智慧的關鍵特徵之一。從技術層面來看,Fable 5 的「手搓 CUDA」與一般透過自動微分或編譯器最佳化不同。傳統的深度學習最佳化工具(如 TensorRT、XLA)通常只能針對已知的運算模式進行有限度調校,而 Fable 5 能直接產生完全自訂的 CUDA 內核,精準控制每個執行緒的工作載荷、共享記憶體使用量,以及全域記憶體存取模式,達到傳統方法難以企及的效率。

這種從零開始的編寫方式,讓模型能跳出人類工程師的慣性思維,找到非直覺但效益極高的最佳化路徑。這項成果也在學術與產業圈引起廣泛討論。部分專家認為,KernelBench-Mega 的高分固然令人振奮,但需要留意測試工具有無過擬合的可能性;不過,Fable 5 的 18.7 倍加速是在未經特別調整的 RTX PRO 6000 環境下測得,複製門檻相對透明。若這項能力可以泛化到更多 GPU 架構與運算場景,未來 AI 訓練與推理的效率將出現跳躍式提升,進一步加速 AI 本身的研究進程,形成「更好的模型寫出更快的程式碼,更快的程式碼訓練出更好的模型」的正向循環。

回到 Fable 5 本身,這款模型由 Fable 團隊開發,主打在程式碼生成與科學計算領域的深度推理能力。雖然官方尚未公布 KernelBench-Mega 的完整評測細節,但已經公開承認這項成績,並表示將持續探索 CUDA 級最佳化的邊界。可以預見的是,這波「AI 寫 CUDA」的競賽才剛開始,Claude、Gemini 等主流模型也都在積極布局相關能力,未來幾個月內可能出現更多突破性數字。對於整個 AI 產業而言,Fable 5 的 2.5 小時、18.7 倍加速不僅是一個令人驚豔的數字,更代表 AI 從「被動遵循人類指令」邁向「主動改進自身執行環境」的關鍵轉折。

當模型能自己寫出比人類工程師更快的 GPU 程式碼,那麼「遞迴自我改進」就不再是科幻小說的情節,而是正在實驗室中發生的真實進展。Anthropic 聯合創始人的那句「開始了」,或許正是對這個新時代最簡潔也最有力的註腳。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

48 分鐘前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

49 分鐘前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

1 小時前