SpaceXAI Releases Grok 4.5, a Cursor-Trained Model for Coding, Agentic Tasks, and Knowledge Work at $2/M Input
重點摘要
SpaceXAI just released Grok 4.5. The company calls it its smartest model to date. It targets coding, agentic tasks, and knowledge work. SpaceXAI says Grok 4.
SpaceXAI 正式推出 Grok 4.5,官方將其定位為目前旗下最智慧的模型,特別針對編碼(coding)、代理任務(agentic tasks)以及知識工作(knowledge work)進行優化。該模型與知名的 AI 程式碼編輯器 Cursor 共同訓練,目標是提供更高效且貼近實際工程需求的解決方案。Grok 4.5 目前已是 Grok Build 的預設模型,並已在 Cursor 與 SpaceXAI 的 API 主控台上線。在訓練方面,Grok 4.5 使用了數萬顆 NVIDIA GB300 GPU 進行大規模運算。
團隊不僅注重原始 token 量,更在數據過濾與策劃投入大量心力,包括去重、品質評分以及領域聚焦選擇。後續的強化學習(reinforcement learning)規模也大幅擴大,重點在於提升每個 token 的智能程度,涵蓋數十萬項任務,多數集中於多步驟軟體工程與其他技術工作。評分方式結合自動化與模型化評估,並且整個訓練堆疊支援高度非同步的代理式任務推演,讓學習過程可以持續進行而不中斷。從基準測試成績來看,Grok 4.5 在多項編碼相關評估中展現競爭力。雖然在 SpaceXAI 自家提供的圖表中,Fable(max)版本在四個基準上均取得最高分,但 Grok 4.
5 在 Terminal Bench 2.1 上與 Fable 差距最小,分別為 83.3% 與 84.3%。在其他基準如 DeepSWE 1.0、DeepSWE 1.1 與 SWE Bench Pro 上,Grok 4.5 也與當前頂尖模型如 GPT 5.5、Opus 4.8 互有領先。以 DeepSWE 1.0 的 pass@1(僅計算首次嘗試通過)為例,Grok 4.5 達到 62.0%,高於 Opus 4.8 的 55.75%,但略低於 Fable(max)的 66.1% 與 GPT 5.5 的 64.31%。
在 SWE Bench Pro 的解決率(resolve rate)上,Grok 4.5 為 64.7%,超越 GPT 5.5 的 58.6% 與 GLM 5.2 的 62.1%,但低於 Opus 4.8 的 69.2% 與 Fable(max)的 80.4%。Grok 4.5 的一大亮點是其 token 使用效率。在 SWE Bench Pro 中,Grok 4.5 平均僅需 15,954 個輸出 token 即可解決任務,而 Opus 4.8(max)則需要 67,020 個,相差約 4.2 倍。官方表示,Grok 4.
5 的 token 效率約為其他領先模型的兩倍,輸出 token 更少代表每次任務的輸出成本與延遲都能降低。該模型的服務速度為每秒 80 個 token(80 TPS),在效率與速度上具有明顯優勢。定價方面,Grok 4.5 的輸入價格為每百萬 token 2 美元,輸出價格每百萬 token 6 美元。目前該模型已在 Grok Build、Cursor(所有方案)以及 SpaceXAI 主控台上線,初期在 Grok Build 與 Cursor 提供有限時間的免費使用。需要留意的是,歐盟地區尚未開放,預計今年 7 月中旬才會支援。
開發者可透過 API 呼叫該模型,模型 ID 為 grok-4.5。除了程式碼相關任務,Grok 4.5 在辦公室工作能力上也獲得驗證。在 Harvey 法律代理基準(Harvey's Legal Agent Benchmark)中,該模型排名第一,顯示其在專業知識工作與法律領域的應用潛力。官方列舉了多種實際使用範例,包括程式碼庫修復(找出錯誤、修復並解釋根本原因)、應用程式原型開發(例如單一提示建立 Three.js 太陽系模擬)、多頁 Excel 模型建置(整合網路研究),以及將大綱轉換為簡報與 Word 報告等,涵蓋各種工程與生產力場景。整體而言,Grok 4.
5 在維持均衡表現的同時,特別強調 token 效率與速度,對於需要大量產出的開發者與企業用戶來說,具備實質吸引力。儘管在部分基準上仍不及專注於極致效能的 Fable(max),但 Grok 4.5 作為通用模型的定位,加上與 Cursor 的深度整合,有望在編碼代理與知識工作領域扮演重要角色。隨著未來歐盟地區的開放,這款模型的應用範圍將會進一步擴大。
Related
相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?
專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議
一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

騰訊是在“賽馬”,還是在打造 “Agent工廠”?
騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。
ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯
2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

openJiuwen發佈業界首個企業級分佈式蜂群架構,聯合郵儲成功落地金融生產環境
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作
**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。