突發:馬斯克交卷最強Grok 4.5,Opus最高級智能打骨折價

2026年7月9日 11:09
突發:馬斯克交卷最強Grok 4.5,Opus最高級智能打骨折價

重點摘要

SpaceXAI 在台灣時間 7 月 9 日凌晨正式發表旗下最強旗艦模型 Grok 4.5,執行長馬斯克親自揭露這款與程式開發工具 Cursor 聯手打造的模型,強調其在編碼與智能體任務上的突破性表現。Grok 4.5 不僅是 SpaceXAI 上市後的第一張王牌,也是與 Cursor 深度整合後交出的第一份成績單。 這款模型在數萬塊輝達 GB300 GPU 上完成訓練,官方公布的效能數據相當亮眼。在 SWE Bench Pro 測試中,Grok 4.5 拿下 64.7% 的解決率,超越 Opus 4.

站內 AI 整理稿

SpaceXAI 在台灣時間 7 月 9 日凌晨正式發表旗下最強旗艦模型 Grok 4.5,執行長馬斯克親自揭露這款與程式開發工具 Cursor 聯手打造的模型,強調其在編碼與智能體任務上的突破性表現。Grok 4.5 不僅是 SpaceXAI 上市後的第一張王牌,也是與 Cursor 深度整合後交出的第一份成績單。這款模型在數萬塊輝達 GB300 GPU 上完成訓練,官方公布的效能數據相當亮眼。在 SWE Bench Pro 測試中,Grok 4.5 拿下 64.7% 的解決率,超越 Opus 4.7 的 64.3%;在 Terminal Bench 2.1 上更一舉衝到 83.

3%;而在 DeepSWE 1.0 中則以 62.0% 的成績強勢壓過 Opus 4.8 的 55.75%。馬斯克直言,Grok 4.5 大致與 Opus 4.7 相當,但速度快上許多。若與 GPT-5.5 相比,在 SWE Bench Pro 上 Grok 4.5 甚至以 64.7% 反超 GPT-5.5 的 58.6%,僅小輸 Opus 4.8 的 69.2%;而 Terminal Bench 2.1 上則以 83.3% 緊咬 GPT-5.5 的 83.4%。在 AAAI 官方測試中排名第四,僅次於 Fable 5、GPT-5.5 與 Opus 4.

8;但在 Harvey 法律智能體基準測試中則奪下第一。Grok 4.5 真正的殺手鐧在於速度、效率與價格。其推理速度高達每秒 80 個 Token,官方宣稱比 flash 類模型更快,甚至能在單句指令下以 Three.js 寫出包含時間加速與八大行星軌道運動的太陽系 3D 模擬器。效率方面,在 SWE Bench Pro 任務中,Grok 4.5 平均僅輸出 15,954 個 Token 就能解決問題,而 Opus 4.8 完成相同工作需耗費 67,020 個 Token,Token 消耗暴減 4.2 倍。

價格上,輸入每百萬 Token 僅 2 美元,輸出每百萬 Token 6 美元,另有一個更快的高級版本定價為輸入 4 美元、輸出 18 美元。相較其他頂級模型動輒十幾美元起步的收費,Grok 4.5 幾乎把成本打到骨折,被外界喻為當前的性價比之王。在訓練方法上,Grok 4.5 除了仰賴數以萬計的 GB300 GPU 進行超大規模運算外,SpaceXAI 更在數據品質上投入大量心力。團隊對海量語料進行嚴格的過濾、去重與質量評分,確保模型接收的每一筆資料都是高信息密度的專業內容。

此外,他們將強化學習的重心放在「單 Token 智能度」這個指標上,而 Cursor 的加入則成為整套訓練飛輪的關鍵一環。Grok 4.5 的底座為 V9(1.5T),訓練時餵入數以萬億計的 Cursor 數據,這些數據記錄了真實開發者如何與代碼庫、工具及智能體互動,使模型學到的不只是「代碼長什麼樣」,更是「人與 AI 協作寫代碼的過程」。訓練棧專門為高度異步設計,智能體可連續運行數小時,模型一邊工作一邊持續學習,幾萬塊 GPU 上的訓練從未間斷,使模型不僅擅長答題,更能勝任長達數小時的多步驟複雜工程任務。馬斯克也預告,下週將把 Grok 4.

5 的上下文長度升級至 100 萬 Token,且下個月會迎來一次階躍式的提升。原因在於 SpaceXAI 正在特斯拉、SpaceX、Neuralink 與 Boring Company 內部,閉合解決真實工程問題的那個環。此外,業界傳出一個擁有 2 萬億參數的更大版本已在路上。面對外界提問,馬斯克坦言公司內部的評估顯示,Grok 4.5 大致與 Opus 4.7 相當,但速度快得多;而他也低調承認,當前真正的王者依然是 Claude Fable。全網開發者也在第一時間進行實測。有人僅用一句話就讓 Grok 4.

5 在單一 HTML 檔中生成出完整的「我的世界」遊戲;也有人用它在一分鐘內完成一整套 2D 與 3D 設計方案;AI 遊戲專家 Danny Limanseta 更藉助 Grok 4.5 打造出一款功能齊全的遊戲。不過,也有部分開發者認為 Grok 4.5 完全無法與 Opus 4.7 相提並論,在生成熔岩燈的測試中效果相當差勁,評價兩極。儘管在最強智能的鐵王座上仍有對手,但馬斯克這一步棋顯然意在重新定義競爭規則。當模型的智能開始像電力一樣按度計費,勝負手便落在誰能讓智能變得更快、更便宜、更無所不在。這一次,他沒有拿出最強的牌,卻以極具破壞力的性價比直接掀翻牌桌。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

3 小時前