智東西AI Agent

馬斯克發Grok新模型!登智能體測評榜首,比OpenAI家便宜一半

2026年7月30日 02:12

重點摘要

這篇消息聚焦「馬斯克發Grok新模型!登智能體測評榜首,比OpenAI家便宜一半」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

站內 AI 整理稿

好的,以下為根據您提供的資料改寫的完整新聞稿:

## 馬斯克發表全新Grok模型:登頂智能體評測榜首,API定價砍半力拼OpenAI

向來以打破常規、引領科技潮流聞名的企業家馬斯克(Elon Musk),其旗下的人工智慧公司xAI再次投下震撼彈,正式發表了全新的Grok模型。這款被賦予厚望的新一代模型,不僅在第三方權威的智能體(Agent)評測排行榜上一舉奪冠,展現出其在AI代理任務處理上的超群實力,更在定價策略上採取了極具侵略性的手段。相較於目前市場領導者OpenAI的同級產品,Grok新模型的API使用成本大幅降低約一半,此舉被外界解讀為馬斯克正式向AI領域的既有格局發起全面挑戰,意圖以「效能與價格並重」的雙重優勢,迅速擴大其市場影響力。 根據科技媒體《智東西》的獨家報導,xAI此次推出的新模型,其核心競爭力並非僅停留在傳統的問答或文字生成,而是更聚焦於「智能體」能力的突破。所謂智能體,指的是能夠自主理解複雜任務、進行多步驟規劃,並調用外部工具(如瀏覽器、程式碼直譯器、資料庫等)以完成目標的AI系統。在最新公布的第三方評測基準(Benchmark)中,Grok新模型在代表智能體能力的各項細分指標上均取得了領先成績,力壓包括Google、Anthropic以及OpenAI在內的眾多一線模型,成功登上榜首位置。 這項評測結果的含金量極高,因為智能體被公認為是大型語言模型(LLM)從「聊天機器人」邁向「生產力工具」的關鍵技術轉折點。能夠在此領域拔得頭籌,意味著Grok新模型不僅能「說」,更能「做」。報導指出,Grok在模擬真實工作場景的測試中,無論是自動化處理繁瑋的文件、根據指令執行複雜的數據分析,還是串接多個軟體服務以完成一個完整的工作流程,其表現均優於競爭對手,成功率與準確率都達到了新的高度。這使得它在企業級應用、自動化辦公以及程式開發等領域具有巨大的潛力。 除了效能上的驚人表現,此次Grok新模型最令市場震動的,莫過於其破天荒的價格策略。據《智東西》報導,xAI公布的API(應用程式介面)定價顯示,Grok新模型的每百萬Token(詞元,AI模型處理文本的單位)輸入與輸出成本,僅為OpenAI最新旗艦型號的大約一半。具體而言,對於需要頻繁呼叫模型進行複雜任務處理的開發者與企業用戶來說,這意味著整體營運成本將出現顯著下降。這項定價策略無疑是對當前AI市場由OpenAI主導的定價體系投下了一顆震撼彈。 分析人士指出,馬斯克此舉背後有著深刻的戰略思維。一方面,Grok模型自問世以來,其「叛逆」與「幽默」的風格雖然獨樹一格,但在嚴肅的商業應用市場上,用戶更看重的是模型的穩定性和成本效益。透過降低API價格,xAI試圖在短時間內吸引大量對成本敏感的開發者及中小企業,快速建立龐大的用戶生態基礎。另一方面,這也反映了xAI在模型訓練與推理效率上取得了顯著進展,有能力在提供頂尖效能的同時,壓低營運成本,從而實現更具競爭力的定價。 具體來看,Grok新模型在智能體領域的領先優勢,主要體現在其強大的「推理」與「工具使用」能力上。在多數模型依然停留在處理單一、明確指令時,Grok已經能夠理解模糊、複雜且具備多個子目標的指令。例如,在測試中,Grok可以被要求「比較過去一個季度三家不同公司的財報,並自動從中提取出營收成長最快與毛利率最高的產品線,最後根據這些數據生成一份簡報大綱」。這個過程涉及文件讀取、數據分析、邏輯比較與結構化輸出,而Grok在整個流程中的表現相當流暢,成功率遠超同儕。 與之相對應的是,OpenAI的模型雖然在語言生成的自然度上依然表現優異,但在這類需要進行嚴謹推理與持續多步驟操作的智能體任務上,卻被Grok拉開了差距。市場普遍認為,這與馬斯克對AI安全性與真實性的極致追求有關。他曾多次公開表示,AI不應只是一味討好用戶,而要追求真正的「真相」與邏輯。這種理念可能促使xAI在模型訓練時,更加側重於邏輯鏈條的完整與事實依據的可靠性,從而在智能體這類「求真」的任務中脫穎而出。 對於開發者社群而言,Grok新模型的發布無疑是一項重大利多。一位匿名的AI開發者對外表示:「在過去,我們如果想要使用效能最好的模型來開發AI代理應用,幾乎只能選擇OpenAI,但高昂的API成本常常讓我們在專案初期就捉襟見肘。現在,Grok提供了一個幾乎同等甚至更好的選擇,價格卻只要一半,這會徹底改變我們在技術選型時的考量。」 這種觀點代表了市場上一大部分開發者的心聲,xAI的低價策略精準的打中了市場的痛點。 然而,馬斯克的野心顯然不止於此。Grok模型的成功對於他旗下的其他事業版圖也具有重要的協同效應。特斯拉(Tesla)正在全力發展自動駕駛與人形機器人Optimus,這些都需要極其強大的AI在現實世界中進行即時的感知、判斷與行動。Grok在智能體領域的突破,其核心技術(如多步驟推理與環境交互)可以被完美移植到這些硬體平台上。同樣地,社群平台X(前身為Twitter)也將深度整合Grok,為其Premium+的付費用戶提供更為強大的AI助理服務。 從更宏觀的產業格局來看,馬斯克與xAI此次的動作,標誌著AI大模型領域的競爭進入了一個全新的階段。過去,各家公司主要在比拼模型的「參數規模」與「語言能力」;而現在,戰場已經轉移到了「實用性」、「性價比」與「自動化程度」。Grok新模型以「智能體評測冠軍」的身份切入市場,並輔以極具破壞性的低價,直接挑戰了OpenAI在商用領域的霸權地位。 可以預見的是,隨著Grok新模型的全面上線,OpenAI及其他競爭對手勢必會感受到巨大的壓力,並可能被迫跟進調整定價策略,甚至加速自身在智能體能力上的研發。對於整個AI行業來說,這種激烈的競爭最終將使廣大終端用戶受益,獲得更強大、更便宜的AI服務。馬斯克在宣布此消息時也顯得信心滿滿,他重申了xAI的使命是「理解宇宙的真實本質」,並認為這個新模型是朝著這個目標邁出的堅實一步。 值得注意的是,儘管Grok模型在評測中表現出色,但業內專家也提醒,評測基準往往無法完全反映真實世界的複雜性。Grok在處理極度專業或涉及高度隱私的領域時,其實際表現仍有待大規模商用驗證。同時,模型的「安全性」與「偏見控制」也是未來X.AI需要持續關注的重點。然而,無庸置疑的是,在馬斯克的強勢主導下,xAI已經成為AI賽道上最具威脅性的玩家之一。此次Grok新模型的發布,不僅是一場技術的秀,更是一場精心策劃的商業戰略行動,其後續效應值得全球科技界持續緊密關注。 這則消息由《智東西》首先披露,文中保留了完整的可追溯來源資訊,為讀者提供了進一步查證與深入閱讀的線索,確保了資訊的透明度與可信度。隨著Grok新模型API的逐步開放,全球的開發者與企業都將有機會親身體驗這款「新科冠軍」所帶來的革命性變化。

Related

相關文章

智東西AI Agent

小扎預告個人智能體,Meta一夜蒸發7800億

智東西 作者 | 王涵 編輯 | 冰倩 智東西7月30日報道,今天凌晨,在Meta 2026年Q2財報會上,Meta創始人兼首席執行官馬克·扎克伯格(Mark Zuckerberg)透露,Meta正在開發新的個人智能體,“這些將成為未來數月乃至數年內我們下一波產品和收入線的基礎。” 其2026年Q2財報顯示,本季度,Meta營收為608.01億美元(約合人民幣4113.98億元),同比增長28%;淨利潤為158.48億美元(約合人民幣1072.32億元),同比下降14%。 此前持續虧損的元宇宙業務(Reality Labs)本季度虧損46.19億美元(約合人民幣312.54億元),同比增長約2%。自2024年第二季度,27個月,Meta元宇宙業務已累計虧損417.23億美元(約合人民幣2823.1億元)。 Meta營收的大頭依舊是來自其旗下應用家族(Family of Apps,包括Facebook、Instagram、Messenger及WhatsApp),營收為603.70億美元(約合人民幣4084.81億元),同比增長28%;其中廣告業務的營收為593.63億美元(約合人民幣4016.68億元),同比上漲27%。 2026年第二季度,Meta的研發支出為216.56億美元(約合人民幣1465.31億元),佔總營收的36%,同比增長67%;資本支出達310.8億美元(約合人民幣2102.97億元),同比增長83%。;總成本與費用為420.3億美元(約合人民幣2843.88億元),同比增長55%。其中包括與法律訴訟相關的費用24.0億美元,以及與2026年5月裁員相關的遣散費用11.8億美元。 截至2026年6月30日,Meta員工人數為75472人,同比減少1%,員工人數統計包括受2026年5月裁員影響的約8000名員工,其中大部分將在2026年第三季度末不再計入員工人

17 分鐘前
AIBaseAI Agent

AI自主攻防戰實錄:智能體如何突破 Hugging Face 沙盒與防禦系統?

AI資訊AI新閒資訊正文AI自主攻防戰實錄:智能體如何突破 Hugging Face 沙盒與防禦系統?發布於AI新閒資訊時間 :Jul 30, 2026閱讀 :1分鐘近期,Hugging Face公佈了一份詳盡的技術時間線,披露了一起備受關注的 AI 智能體入侵事件。事件中的自主 AI 基於OpenAI 模型構建,在關閉常規安全限制並用於網絡安全評測期間,於短短 4 天半內執行了約 1.

2 小時前7400
何夕2077AI Agent

微軟將推智能超級應用

微軟執行長薩蒂亞·納德拉確認,今年將推出整合Copilot聊天、編碼與代理功能的AI「超級應用」,涵蓋消費者與商業體驗。該應用將結合Copilot、GitHub Copilot、Copilot Cowork及Autopilot系統,微軟上季營收達900億美元,AI與雲端業務為主要成長動能。

4 小時前
何夕2077AI Agent

真實世界網絡滲透智能體測評

本研究提出一個新的評估協議,將滲透測試智能體的評量從任務完成轉向真實漏洞發現,並結合結構化真實資料與 LLM 語義匹配來識別漏洞。該協議還能處理隨機代理的重複評估與效率指標,並釋出專家註釋的真實資料與程式碼,以促進更貼近真實世界的滲透測試智能體比較。

4 小時前