谷歌反擊!Gemini 4 Argon性能比肩Astra,成本僅60%

2026年10月1日 01:43
站內 AI 整理稿

編譯 | 楊京麗 編輯 | 心緣 10月1日消息,今天凌晨,谷歌發佈新一代旗艦模型Gemini 4 Argon,重點面向軟件工程、法律與金融等企業知識工作,以及網絡安全防禦等複雜、長週期任務。在衡量長程軟件工程能力的DeepSWE v1.1測試、評估金融、編程、法律和稅務等企業知識工作的Vals Index、測試企業端到端自動化執行能力的AutomationBench,以及考察長視頻理解能力的LVBench中,Gemini 4 Argon均領先GPT-6 Astra、Claude Fable 5.1和Claude Opus 5.

5等模型;在評估漏洞修復能力的CWE-bench v1中,Argon以68%的成績與GPT-6 Astra並列第一。在Text Arena的模型成本與得分對比中,Gemini 4 Argon High以1525分和每百萬Token 8美元的混合價格,進入成本-性能前沿。目前,在Artificial Analysis Intelligence Index中,Gemini 4 Argon得分53分,僅落後於Claude Opus 5.5和Claude Sonnet 5.5,得分與Claude Fable 5.1、GPT-6 Astra並列。

▲Gemini 4 Argon在Artificial Analysis上測評情況(圖源:Artificial Analysis) 不過,彭博社援引知情人士稱,部分谷歌員工認為,Gemini 4雖然在行業基準測試中表現亮眼,但在實際工作中並不總能達到同等水平,尤其是在部分編程任務上仍較為吃力,這與谷歌當天發佈的測試成績形成反差。Gemini 4 Argon現已通過“Fairwind計劃”向一批經過篩選的網絡安全防禦團隊開放。谷歌計劃先收集早期測試反饋、繼續完善安全護欄,隨後逐步向開發者、企業和消費者開放,首批用戶將包括付費API客戶和Google AI Ultra訂閱者。

Argon API初始價格為每百萬輸入Token 2美元(約合人民幣13.4元)、每百萬輸出Token 10美元(約合人民幣67元),緩存輸入Token價格在輸入Token基礎上降低95%,即每百萬Token約0.1美元(約合人民幣0.67元)。根據Artificial Analysis,按折扣定價,Gemini 4 Argon的每任務成本為1.99美元,較GPT-6 Astra(max)降低40%。

▲Gemini 4 Argon每任務成本與其他模型對比(圖源:Artificial Analysis) 谷歌首席執行官桑達爾·皮查伊(Sundar Pichai)稱,外界對下一代模型的討論很多,因此希望儘早展示Gemini 4 Argon。谷歌內部團隊已廣泛將其用於編程、量子計算等工作,反饋良好。▲皮查伊發文官宣Gemini 4 Argon(圖源:X) 一位X用戶認為,Gemini 4對提示詞格外敏感,輸出內容和風格受提示詞影響的程度超過其他模型,默認風格不佳,但增加一句提示詞就容易改善。他還展示了用不同提示詞復刻《樂高星球大戰》關卡的效果。

▲開發者對於Gemini 4 Argon的評價(圖源:X) 另一位開發者認為,在一次生成細節豐富、美感出色的3D場景方面,Gemini 4 Argon尚未達到Opus 5的水平。Gemini 4 Argon在畫面細節上,效果略顯粗糙。▲開發者對比Gemini 4 Argon(上)和Claude Opus 5(下)的生成效果(圖源:X) 一、輸出上限提升至100萬Token,編程能力與企業任務測試突出 Gemini 4 Argon將模型輸出Token上限從此前的6.4萬Tokens提升至100萬Tokens,成為目前業內輸出容量最高的模型之一。

更大的輸出空間允許模型在單次任務中深度思考,並生成數十萬甚至上百萬Token,用於處理大型代碼庫、複雜研究和多步驟企業流程。編程方面,Gemini 4 Argon在衡量真實世界長期軟件工程能力的DeepSWE v1.1測試中取得77.9%的成績,刷新該測試的最好紀錄。在覆蓋金融、編程、法律和稅務等工作的Vals Index中,Argon排名第一。Argon還在Vals Finance Agent v2測試(多步驟金融研究)、Harvey法律Agent測試(法律研究與起草)中取得領先成績。在Zapier用於評估企業端到端自動化執行能力的AutomationBench中,Argon得分51.

3%,位列第一,明顯領先GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5等模型。Argon的多模態能力也被用於長視頻和專業圖表分析。在評估長視頻理解能力的LVBench中,該模型得分91.7%,達到現有模型最優水平。二、深入谷歌內部工作流,完成量子算法優化與大規模代碼遷移 在谷歌內部,數千名員工已將Gemini 4 Argon用於日常調試、算法設計、研究和大規模代碼遷移等工作。谷歌舉例稱,Argon曾幫助量子計算研究人員優化量子算法的時空資源,在數分鐘內將一項公開基線結果提升40%。

另外,一組Argon Agent分析了覆蓋谷歌整個服務器集群的性能分析遙測數據,自主識別並實施數據中心內存優化方案。相關方案部署後,可釋放超過300TiB內存,預計總節省量將達到500TiB至1PiB。Argon Agent還參與了谷歌內部C/C++代碼向Rust的遷移,覆蓋數萬行的核心庫代碼,以及超過80萬行的Fuchsia Zircon內核。考慮到相關係統的重要性,谷歌稱,所有大規模重寫都必須經過自動化和人工審計、仿真測試及代碼審查,確認安全後才能部署到生產環境。以開源視頻解碼器libgav1為例,Argon Agent通過多輪性能分析和實驗,重寫了約3.

2萬行SIMD代碼,使編譯器能夠自動完成向量化。遷移後的Rust版本在保持視頻輸出完全一致的情況下,運行速度達到原Rust版本的2.7倍,性能進一步接近經過優化的C++版本。三、強化網絡安全能力,可自主發現和修復漏洞 谷歌還針對網絡安全防禦能力對Gemini 4 Argon進行了專項訓練。Argon可以自主發現、驗證並修復軟件漏洞。對於經過信任認證的網絡安全防禦團隊和谷歌內部團隊,谷歌將提供不帶網絡安全護欄的Argon版本,以便其發揮完整的漏洞分析和防禦能力。網絡安全公司Wiz已通過“Scan for Good”項目使用Argon,為關鍵公共基礎設施免費發現和修復高風險暴露。

谷歌稱,在一次早期測試中,Argon發現了一個影響全球醫院所使用醫療軟件的嚴重漏洞,該漏洞可能導致敏感個人信息暴露,且此前的前沿模型沒有識別出這一風險。在評估漏洞修復能力的CWE-bench v1中,Argon以68%的成績並列第一,得分與Grok 4.7和GPT-6 Astra相當。谷歌內部的綜合漏洞基準測試顯示,Argon可以在覆蓋20種編程語言的複雜代碼庫中發現多類安全暴露。在Wiz的黑盒滲透測試中,Argon在識別真實網站攻擊面、發現漏洞以及生成概念驗證方面,也超過了此前的Gemini 3.8 Flash Cyber。

四、擴大安全測試,重點防範模型濫用與提示注入 在正式擴大開放前,谷歌將繼續強化四類前沿安全能力。防範濫用方面,Argon會拒絕可能用於網絡攻擊以及化學、生物、放射性和核武器攻擊的有害請求,同時保留合法的雙重用途科學研究能力。谷歌還在加強對模型內部激活狀態的監測,以識別潛在的濫用行為。Argon在防禦間接提示注入方面也取得進展。此類攻擊會通過惡意指令或外部上下文劫持模型行為。經過自動化紅隊測試和對抗訓練後,Argon在Gray Swan的間接提示注入測試中取得領先成績。

監測目標偏離方面,為防止Argon在執行任務時越過邊界、採取超出用戶意圖的行動,谷歌部署了目標偏離緩解機制,對Argon的思維鏈和行為進行監測,並在必要時停止執行。谷歌還使用類似系統監測模型訓練過程,並在發現異常時向專門的事件響應團隊發出警報。強化系統環境方面,隨著前沿模型的能力不斷增強,安全測試也需要與模型能力相匹配的安全環境。按照Agent控制路線圖,谷歌將在高風險訓練或評估開始前,對沙盒環境進行隔離和封閉,以進一步強化安全性。

結語:瞄準複雜Agent任務,實際效果仍待驗證 Gemini 4 Argon在長週期軟件工程、金融和法律Agent任務、長視頻理解及網絡安全防禦等測試中取得多項領先成績,100萬Token輸出上限也增強了其處理大型代碼庫和複雜工作流的能力。不過,當前多數成績仍來自谷歌披露的內部案例和基準測試,模型尚未全面開放。Argon在真實使用中的穩定性、調用成本、漏洞修復可靠性及安全邊界,仍需等待開發者和企業用戶進一步驗證。來源:谷歌、Arena、X

Related

相關文章

量子位生成式AI

何愷明團隊新作:看貓片就能學會ARC挑戰

何愷明團隊提出NAT-ARC,一種純視覺的ARC解題方案,不依賴語言模型,而是使用ImageNet上的自然圖像進行MAE預訓練,再遷移到抽象格子推理任務。該方法在ARC-1上達到63.4%的單模型pass@2分數,集成後提升至70.2%,逼近專用LLM系統的表現,並證明了視覺預訓練能有效破解抽象推理的scaling瓶頸。

剛剛
量子位生成式AI

谷歌Gemini 4突然發佈!RSI加持,GPT和Opus都讓讓

。。。 假期第一天,谷歌攜Gemini 4 Argon空降多榜單第一。 拳打Opus 5.5,腳踢GPT-6 Astra。 更誇張的還在後頭,單項任務成本最低可至1.99美元,直接是Astra費用砍半。 最高百萬Token輸出上限,面向編程、金融和法律等複雜工作流,而且劃重點,網絡安全防禦能力超牛掰。 這波等等黨要贏麻了。 不過吧,咱普通用戶現在只可遠觀,暫時還吃不上。

剛剛
鈦媒體生成式AI

階躍星辰“第一梯隊”,是“自嗨”嗎?

AIX財經2026.10.01 18:22 · 來自福建全文5252字00:00 / 15:27同行各自跑出了主線,階躍的“全棧”能跑通嗎?文 | AIX財經,作者|雷晶,編輯|魏佳沉寂許久的階躍星辰,正試圖擠進大模型第一梯隊。9月20日,它發佈Step 5 Preview,原生支持文本與視覺輸入,重點面向編程、軟件工程、專業知識工作和長程Agent任務。上線初期,登錄並完成首次調用後可獲得30天的Step Plan免費使用權。幾天後,Step Plan的月度套餐一度售罄。

剛剛
MarkTechPost AI生成式AI

Cohere 發布 Embed 5:與 Voyage 4 Large、Gemini Embedding 2 及 OpenAI 的比較

Cohere 推出全新嵌入模型系列 Embed 5,專注於企業搜尋、RAG 及代理檢索。該系列分為兩個版本:Embed 5 Pro 專注於最高檢索品質,Embed 5 Fast 則針對即時查詢路徑的延遲與成本最佳化。兩者皆支援文字、圖片及文字與圖片混合輸入,涵蓋 100 種以上語言,且可處理多達 128K token。關鍵設計在於 Pro 與 Fast 共享同一嵌入空間,因此可用其中一個進行索引,另一個進行查詢。目前這兩個版本已在 Cohere API、Model Vault、Microsoft Foundry 及 Amazon SageMaker 上正式上線,私有 VPC 或本地部署則可透過 vLLM 提供服務。根據 Cohere 模型文件,API 模型 ID 分別為 embed-v5.0-pro 和 embed-v5.0-fast,兩者輸出維度皆為 2048 或 1536。

57 分鐘前
鈦媒體生成式AI

騰訊經銷、字節駐場、Kimi借船:FDE成了大模型的新成本?

新立場Pro2026.10.01 16:16 · 來自四川全文5421字00:00 / 16:08AI公司活成了它們最討厭的樣子。文 | 新立場Pro今年 3 月 6 日上午十點,深圳騰訊大廈樓下開始排隊。人們帶著電腦,等騰訊雲工程師幫自己安裝 OpenClaw,首批八十多人在十點開始排隊,到十一點,數百個預約號已經發完。

1 小時前
鈦媒體生成式AI

谷歌推出了個“做題家”:Gemini 4 Argon屠榜,但幹活差點意思

字母AI2026.10.01 16:16 · 來自北京全文3510字00:00 / 09:31消失10個月的谷歌,為什麼連Pro這塊招牌都扔了?文 | 字母AIGemini 4可算來了,連名字也換了:這次的旗艦不叫Pro,叫Argon。從谷歌公佈的成績看,Gemini 4 Argon在知識工作方面表現搶眼,多項測試超過了OpenAI和Anthropic的旗艦模型。它主打一個知識面廣,從金融、法律到數學、科學,都有不錯的表現。谷歌還確認,9月15日在LMArena上亮相、表現接近GPT-6 Astra的“3.

1 小時前