谷歌最前沿 AI 模型:Gemini 4 Argon 登場,長週期代碼工程 DeepSWE 測試超 Claude Opus 5.5

2026年9月30日 06:57
谷歌最前沿 AI 模型:Gemini 4 Argon 登場,長週期代碼工程 DeepSWE 測試超 Claude Opus 5.5
站內 AI 整理稿

作者:故淵 責編:故淵 評論: 感謝網友 HH_KK、火瓶座、Skyraver 的線索投遞!10 月 1 日消息,谷歌昨日(9 月 30 日)發佈 Gemini 4 Argon,稱其為公司迄今最先進的 AI 模型,但目前並未面向公眾全面開放。定位方面,Gemini 4 Argon 是谷歌當前“最先進”模型,重點是長流程軟件工程、企業知識工作和網絡安全防禦。官方稱其在真實世界軟件工程測試創紀錄,網絡安全基準並列第一,並在金融、法律等專業任務基準領先。

模型特性方面,Gemini 4 Argon 單次輸出上限達到約 100 萬 tokens,高於此前的 64,000 tokens,適合處理大型代碼庫、長文檔和多階段任務。谷歌 DeepMind Gemini 產品負責人 Tulsee Doshi 表示:“Argon 是一個功能全面的模型,在多個領域都具備前沿能力。”在新模型在某些編碼和知識工作基準測試中處於最先進水平,在多個方面都優於競爭對手 OpenAI 的前沿模型 GPT-6 Astra。性能方面,谷歌宣稱其 DeepSWE v1.1 得分為 77.9%。Claude Opus 5.5 的得分為 74.

2%,GPT-6 Astra 的得分為 74.1%。安全防禦性能方面,谷歌對 Gemini 4 Argon 進行了訓練,使其“在網絡安全防禦方面能力超群”,比 3.8 Flash Cyber 有了顯著提升。在評估模型修復安全漏洞能力的 CWE-bench v1 測試中,Argon 以 68% 的最高分並列第一。評測項目Gemini 4 Argon對比 / 排名主要考察能力 DeepSWE v1.177.9%第 1;Claude Opus 5.5 為 74.2%,GPT-6 Astra 為 74.1%長週期、真實軟件工程任務 Vibe Code Bench91.

9%領先競爭模型自然語言到代碼、應用構建 CWE-bench v168%並列第 1自動發現並修復軟件安全漏洞 AutomationBench51.3%第 1跨業務軟件的端到端自動執行 LVBench91.7%當前最佳 / State of the art長視頻理解 GraphWalks,0–128K99.7%極高水平長上下文圖結構推理 GraphWalks,256K–1M84.2%明顯領先超長上下文推理 Agent’s Last Exam39.5%高於 GPT-6 Astra 的 34.2%綜合代理與知識推理 Vals Index68.9%高於 GPT-6 Astra 的 63.

1%、Claude Opus 5.5 的 67.0%金融、編程、法律、稅務等經濟任務 Artificial Analysis Intelligence Index53與 GPT-6 Astra 持平多項綜合智能與代理能力分發方面,谷歌表示會分階段發佈,第一階段通過名為 Fairwind Program 的計劃,提供給受信任的網絡安全防禦者,並參與美國政府的自願預發佈模型訪問流程。費用方面,谷歌計劃先向付費 API 客戶和 Google AI Ultra 用戶開放,之後再擴大到企業和普通消費者:項目初始價格後續價格輸入 tokens每百萬 2 美元(注:現匯率約合 13.

4 元人民幣)每百萬 4 美元(現匯率約合 26.9 元人民幣)輸出 tokens每百萬 10 美元(現匯率約合 67.2 元人民幣)每百萬 20 美元(現匯率約合 134.4 元人民幣)緩存輸入 tokens輸入價格的約 95% 折扣— 投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:谷歌,Gemini,AI谷歌最強 AI 模型:Gemini 4 Pro 開測,SVG 生圖表現驚豔谷歌最強音樂 AI Lyria 3.

5 塞進 Gemini:一鍵生成 3 分鐘完整歌曲谷歌在搜索和 Gemini 中推出多款全新 AI 學習工具,含交互式可視化內容、3D 模擬等谷歌 AI 重組內幕曝光:布林不滿落後 Anthropic,要求全力投入 Gemini 模型3.6 Flash 發佈不到 1 個月,谷歌 Gemini 3.7 Flash AI 模型蹤跡曝光曝谷歌測試新版主頁:能創建圖片、解讀文件,唯獨少了搜索按鈕

Related

相關文章

量子位生成式AI

何愷明團隊新作:看貓片就能學會ARC挑戰

何愷明團隊提出NAT-ARC,一種純視覺的ARC解題方案,不依賴語言模型,而是使用ImageNet上的自然圖像進行MAE預訓練,再遷移到抽象格子推理任務。該方法在ARC-1上達到63.4%的單模型pass@2分數,集成後提升至70.2%,逼近專用LLM系統的表現,並證明了視覺預訓練能有效破解抽象推理的scaling瓶頸。

剛剛
量子位生成式AI

谷歌Gemini 4突然發佈!RSI加持,GPT和Opus都讓讓

。。。 假期第一天,谷歌攜Gemini 4 Argon空降多榜單第一。 拳打Opus 5.5,腳踢GPT-6 Astra。 更誇張的還在後頭,單項任務成本最低可至1.99美元,直接是Astra費用砍半。 最高百萬Token輸出上限,面向編程、金融和法律等複雜工作流,而且劃重點,網絡安全防禦能力超牛掰。 這波等等黨要贏麻了。 不過吧,咱普通用戶現在只可遠觀,暫時還吃不上。

剛剛
鈦媒體生成式AI

階躍星辰“第一梯隊”,是“自嗨”嗎?

AIX財經2026.10.01 18:22 · 來自福建全文5252字00:00 / 15:27同行各自跑出了主線,階躍的“全棧”能跑通嗎?文 | AIX財經,作者|雷晶,編輯|魏佳沉寂許久的階躍星辰,正試圖擠進大模型第一梯隊。9月20日,它發佈Step 5 Preview,原生支持文本與視覺輸入,重點面向編程、軟件工程、專業知識工作和長程Agent任務。上線初期,登錄並完成首次調用後可獲得30天的Step Plan免費使用權。幾天後,Step Plan的月度套餐一度售罄。

剛剛
MarkTechPost AI生成式AI

Cohere 發布 Embed 5:與 Voyage 4 Large、Gemini Embedding 2 及 OpenAI 的比較

Cohere 推出全新嵌入模型系列 Embed 5,專注於企業搜尋、RAG 及代理檢索。該系列分為兩個版本:Embed 5 Pro 專注於最高檢索品質,Embed 5 Fast 則針對即時查詢路徑的延遲與成本最佳化。兩者皆支援文字、圖片及文字與圖片混合輸入,涵蓋 100 種以上語言,且可處理多達 128K token。關鍵設計在於 Pro 與 Fast 共享同一嵌入空間,因此可用其中一個進行索引,另一個進行查詢。目前這兩個版本已在 Cohere API、Model Vault、Microsoft Foundry 及 Amazon SageMaker 上正式上線,私有 VPC 或本地部署則可透過 vLLM 提供服務。根據 Cohere 模型文件,API 模型 ID 分別為 embed-v5.0-pro 和 embed-v5.0-fast,兩者輸出維度皆為 2048 或 1536。

58 分鐘前
鈦媒體生成式AI

騰訊經銷、字節駐場、Kimi借船:FDE成了大模型的新成本?

新立場Pro2026.10.01 16:16 · 來自四川全文5421字00:00 / 16:08AI公司活成了它們最討厭的樣子。文 | 新立場Pro今年 3 月 6 日上午十點,深圳騰訊大廈樓下開始排隊。人們帶著電腦,等騰訊雲工程師幫自己安裝 OpenClaw,首批八十多人在十點開始排隊,到十一點,數百個預約號已經發完。

1 小時前
鈦媒體生成式AI

谷歌推出了個“做題家”:Gemini 4 Argon屠榜,但幹活差點意思

字母AI2026.10.01 16:16 · 來自北京全文3510字00:00 / 09:31消失10個月的谷歌,為什麼連Pro這塊招牌都扔了?文 | 字母AIGemini 4可算來了,連名字也換了:這次的旗艦不叫Pro,叫Argon。從谷歌公佈的成績看,Gemini 4 Argon在知識工作方面表現搶眼,多項測試超過了OpenAI和Anthropic的旗艦模型。它主打一個知識面廣,從金融、法律到數學、科學,都有不錯的表現。谷歌還確認,9月15日在LMArena上亮相、表現接近GPT-6 Astra的“3.

1 小時前