昨夜,馬斯克甩出Grok 4.6!性能直逼Fable 5,英偉達祝賀

2026年8月12日 17:07
站內 AI 整理稿

編譯 | ZeR0 編輯 | 漠影 8月13日消息,昨夜,馬斯克轉發SpaceXAI推文,宣佈推出新一代旗艦模型Grok 4.6,它具有智能、快速、性價比超高的特點。相比Grok 4.5,Grok 4.6在相同價格下性能顯著優化。從其披露的多項智能體編程和知識工作基準測試來看,Grok 4.6 high綜合性能與GPT-5.6 Sol Max、Claude Fable 5 Max相當。英偉達第一時間在評論區留言“恭喜發佈”。Grok 4.6現已在Cursor和Grok Build上發佈,也已在API和其他合作伙伴(如OpenRouter、Vercel和Cloudflare)的平臺上發佈。

首周,Grok Build和Cursor內均提供2倍的使用量,讓用戶可立即體驗4.6版本。其定價為每百萬輸入token 2美元(約合人民幣13元),每百萬輸出token 6美元(約合人民幣40元),還有一種快速版本的價格是普通版本的2倍。在最新披露的Code Arena代碼競技場WebDev測試結果中,Grok 4.6 (High)以1618分數排名第七,與GPT-5.6 Sol (xHigh)、GLM-5.2 (Max)、Claude Fable 5分數十分接近。Grok 4.6在Grok 4.

5的基礎上進行了改進,特別注重長期運行的智能體以及更具挑戰性的交互式和視覺化工作,能處理多步驟的複雜任務,包括研究主題、分析信息、跨代碼庫工作、將想法轉化為完善的應用程序或作品等。與Grok 4.5相比,Grok 4.6進行了更長時間的補充訓練,使用了經過篩選的模型生成數據(用於推理和高級技術概念)、高質量的工程數據,以及改進的優化器和訓練方案。這為後續的SFT和RL階段奠定了更堅實的基礎。然後,研發團隊使用Grok 4.5重新生成了SFT在推理過程、智能體框架以及STEM、軟件工程和知識工作等領域中的軌跡,並通過基於模型的檢查過濾掉了問題軌跡。

最終得到的SFT檢查點展現出優異的性能和改進的行為。Grok 4.6經過廣泛的智能強化學習任務訓練,包括知識工作、通用編碼以及核優化、Web開發、計算機輔助設計等領域的特定環境。SpaceXAI團隊對Grok 4.6進行了測試,旨在拓展其應用範圍,並檢驗其在多步驟工作中持續改進的能力,發現該模型尤其擅長將寬泛的產品構想轉化為可運行的初始版本。它能夠研究陌生的領域,構建應用程序框架,實現核心交互,並通過多輪反饋不斷完善最終成果。在更長的軌跡上,他們也開始看到更多的自我測試和驗證,模型會在繼續前進之前檢查自己的工作。與Grok 4.5相比,Grok 4.

6在視覺和交互項目的第一階段就能生成更強大的成果。給定一個具體的產品構想,它只需一次迭代即可為應用程序構建結構和視覺語言。這使得它對於那些需要先構建一個實質性框架,然後不斷迭代才能快速取得理想結果的項目尤為有用。同時,Grok 4.6的安全防護措施已根據模型的功能進行了改進和校準。其安全堆棧旨在最大限度地提高合法使用場景的實用性和安全性,使Grok 4.6能在漏洞修補、加速工程設計週期和增強AI研究等領域發揮作用並保障安全。來源:SpaceXAI

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛