谷歌推出了個“做題家”:Gemini 4 Argon屠榜,但幹活差點意思

字母AI2026.10.01 16:16 · 來自北京全文3510字00:00 / 09:31消失10個月的谷歌,為什麼連Pro這塊招牌都扔了?文 | 字母AIGemini 4可算來了,連名字也換了:這次的旗艦不叫Pro,叫Argon。從谷歌公佈的成績看,Gemini 4 Argon在知識工作方面表現搶眼,多項測試超過了OpenAI和Anthropic的旗艦模型。它主打一個知識面廣,從金融、法律到數學、科學,都有不錯的表現。谷歌還確認,9月15日在LMArena上亮相、表現接近GPT-6 Astra的“3.8 Flash”,其實就是Gemini 4 Argon。
曾與Anthropic、OpenAI並駕齊驅的谷歌,此前因Gemini 3.5 Pro表現未達預期,加上內部人事動盪,一度掉隊。這一次,谷歌能靠Gemini 4 Argon翻盤嗎?Gemini 4 Argon性能如何?據谷歌介紹,Gemini 4 Argon採用了公司迄今規模最大的預訓練。這也是谷歌時隔10個月推出的新一代旗艦。和其他旗艦模型一樣,它瞄準的是長程編程任務、企業級知識工作和網絡安全防禦。在谷歌公佈的18項基準測試中,Argon拿下12項第一、1項並列第一;GPT-6 Astra拿下3項第一、1項並列第一,Claude Opus 5.5則拿下2項第一。
至少在這份成績單上,谷歌的領先項目數超過了OpenAI和Anthropic。在長程軟件工程測試DeepSWE v1.1中,Argon以77.9%的成績刷新紀錄,高於Astra的74.1%和Opus 5.5的74.2%。在衡量知識工作能力的Vals Index中,Argon以68.9%的成績排名第一;在Zapier的業務自動化測試AutomationBench中,它以51.3%領先,Opus 5.5和Astra分別為42.5%和41.4%。在金融研究測試Vals Finance Agent v2中,Argon得分65.4%;在法律任務測試Harvey Legal Agent中,它得分19.
6%,Astra為5.4%,約為它的四分之一。在長視頻理解測試LVBench中,Argon得分91.7%;在GraphWalks的長上下文圖檢索測試中,得分84.2%。網絡安全方面,Argon與Astra在CWE-bench v1中以68%並列第一。在Gray Swan的提示注入測試中,針對Argon的攻擊成功率僅為0.7%,是參測模型中最低的,Astra則為8.5%。成績單很漂亮,但Argon並非處處領先。它的短板,出現在部分軟件工程、終端操作和科學任務上。在FrontierSWE v2中,Argon得分55.0%,Astra為65.5%;在Terminal-Bench Science 0.
1中,兩者分別為57.6%和68.1%。兩項測試中,Argon都落後10.5個百分點。在衡量Agent終端操作能力的Terminal-Bench 4.0中,Argon得分57.4%,也低於Opus 5.5的66.4%和Astra的58.2%。這些結果說明,Argon在知識工作上有優勢,但面對一些需要持續操作、執行的任務,仍未追上對手。Argon的另一個特點是少說沒把握的話。在Artificial Analysis的AA-Omniscience測試中,它的幻覺率最低。在未能答對的問題中,Argon只有15%給出了錯誤答案,其餘選擇承認“不知道”。
這一指標衡量的是模型有多愛“瞎編”,不等於答題正確率。作為對比,GPT-6 Astra在不同推理設置下的幻覺率為45%至51%,Opus 5.5和Fable 5.1在最高推理設置下分別為59%和73%。不過,榜單成績還不能直接等同於使用體驗。谷歌自報的測試結果,尤其需要結合獨立評測來看。GPT-6 Astra此前自報ARC-AGI-3成績達到99.9%,隨後就引發了對測試可信度的質疑。Gemini 4 Argon發佈不到一小時,也有外媒質疑其評分,稱部分試用過的谷歌員工認為,分數高於實際表現。
在Artificial Analysis公佈的智能指數圖中,Argon得分53分,與Astra、Claude Fable 5.1同分,低於Opus 5.5。目前,普通用戶和開發者還用不上Argon。首批獲准使用的是谷歌Fairwind計劃中的網絡安全防禦人員。價格倒是頗有吸引力。嚐鮮期內,Argon每百萬輸入token收費2美元,每百萬輸出token收費10美元;緩存命中的輸入價格再降95%,為每百萬token 0.10美元,低於Astra和Opus 5.5。嚐鮮期結束後,標準價格將恢復至每百萬輸入token 4美元、輸出token 20美元,與Opus 5.5相同。Pro去哪了?
Argon意為氬,是一種化學性質穩定、很少與其他物質發生反應的稀有氣體,算得上元素週期表裡的“宅男”。谷歌稱,新的“元素命名法”是為了將旗艦架構與更輕量的Flash系列區分開。有意思的是,Argon首次公開露面時,卻披著Flash的外衣。9月15日,它以“gemini-3.8-flash”的名字出現在LMArena上。不少網友拿它做鵜鶘測試,發現效果與Astra相差無幾,紛紛感嘆:Flash都這麼強了,Pro還了得?如今謎底揭曉,他們提前試到的就是旗艦。除了性能,谷歌這次還著重介紹了Argon的安全設計。此前,谷歌與OpenAI、Anthropic一樣,都曾曝出模型被越獄的問題。
這一次,谷歌為首批用戶提供了一個移除網絡安全護欄的特別版本。谷歌稱,這樣做是為了減少模型誤拒絕正常安全研究請求的情況,讓防禦人員能夠檢查潛在攻擊入口、發現並修補漏洞。谷歌還介紹了“監控內部激活”的安全手段,用來識別模型推理過程中的風險信號。這意味著,安全檢查除了篩查輸入,還會監控模型的思維鏈和內部激活信號。一旦檢測到模型正在生成進攻性網絡行為的相關內容,運行時監控系統就會中斷生成。據谷歌介紹,Argon已經在公司內部幹起了活。
它幫助量子計算團隊優化編譯流程,將時空開銷較已發表的基線降低40%;分析跨數據中心的性能數據並修補問題,釋放超過300 TiB內存;將C/C++代碼遷移至Rust,涉及re2、libgav1,以及80萬行的Fuchsia OS Zircon內核。其中,libgav1的3.2萬行SIMD代碼被改寫為安全的Rust代碼後,運行速度達到原Rust版本的2.7倍,輸出結果保持一致。9月14日,谷歌還曾聯合馬里蘭大學、弗吉尼亞大學發佈論文《Dream-RSI》。這篇論文提出,將Agent過去的搜索歷史保存為一棵“發現樹”,讓它沿著這棵樹反覆“做夢”,離線嘗試不同的探索策略,無須重新運行真實實驗。
在六個數據集上,這種方法將發現型Agent的調用次數降至原來的約1/162,減少了探索過程中的調用開銷。Argon也採用了這套方法,以提高訓練效率。谷歌這一陣到底去哪了自Gemini 3 Pro發佈以來,谷歌已近10個月沒有推出新一代旗艦。2026年2月19日,谷歌推出了Gemini 3.1 Pro小幅更新,但原定6月發佈的Gemini 3.5 Pro遲遲未能通過內部測試。當時,行業競爭的重心已轉向編程和Agent,Gemini 3.5 Pro卻未能在多文件代碼重構、自主Agent執行等任務中,展現出相對OpenAI和Anthropic的明確優勢。7月17日,外媒報道稱,Gemini 3.
5 Pro因編程表現不達標,將推遲數月發佈。當天,Alphabet股價一度下跌4%。8月,DeepMind迎來人事調整。哈薩比斯卸任DeepMind CEO,轉任Alphabet首席科學家;傑夫則離開首席科學家崗位,與朋友創業。科雷·卡武克丘奧盧(Koray Kavukcuoglu)接掌DeepMind,直接向皮查伊彙報。外媒將其視為谷歌近年來最大的一次AI領導層調整。這段時間,谷歌主要靠Flash系列維持聲量,同時啟動Fairwind計劃,與多家網絡安全公司合作。9月24日,科雷表示,Gemini 4已進入後訓練階段,將盡快發佈,不必等到年底。如今,Gemini 4 Argon終於來了。
我的谷歌會員要不要續,等真正用上它再說。
Related
相關文章

何愷明團隊新作:看貓片就能學會ARC挑戰
何愷明團隊提出NAT-ARC,一種純視覺的ARC解題方案,不依賴語言模型,而是使用ImageNet上的自然圖像進行MAE預訓練,再遷移到抽象格子推理任務。該方法在ARC-1上達到63.4%的單模型pass@2分數,集成後提升至70.2%,逼近專用LLM系統的表現,並證明了視覺預訓練能有效破解抽象推理的scaling瓶頸。

谷歌Gemini 4突然發佈!RSI加持,GPT和Opus都讓讓
。。。 假期第一天,谷歌攜Gemini 4 Argon空降多榜單第一。 拳打Opus 5.5,腳踢GPT-6 Astra。 更誇張的還在後頭,單項任務成本最低可至1.99美元,直接是Astra費用砍半。 最高百萬Token輸出上限,面向編程、金融和法律等複雜工作流,而且劃重點,網絡安全防禦能力超牛掰。 這波等等黨要贏麻了。 不過吧,咱普通用戶現在只可遠觀,暫時還吃不上。

階躍星辰“第一梯隊”,是“自嗨”嗎?
AIX財經2026.10.01 18:22 · 來自福建全文5252字00:00 / 15:27同行各自跑出了主線,階躍的“全棧”能跑通嗎?文 | AIX財經,作者|雷晶,編輯|魏佳沉寂許久的階躍星辰,正試圖擠進大模型第一梯隊。9月20日,它發佈Step 5 Preview,原生支持文本與視覺輸入,重點面向編程、軟件工程、專業知識工作和長程Agent任務。上線初期,登錄並完成首次調用後可獲得30天的Step Plan免費使用權。幾天後,Step Plan的月度套餐一度售罄。

騰訊經銷、字節駐場、Kimi借船:FDE成了大模型的新成本?
新立場Pro2026.10.01 16:16 · 來自四川全文5421字00:00 / 16:08AI公司活成了它們最討厭的樣子。文 | 新立場Pro今年 3 月 6 日上午十點,深圳騰訊大廈樓下開始排隊。人們帶著電腦,等騰訊雲工程師幫自己安裝 OpenClaw,首批八十多人在十點開始排隊,到十一點,數百個預約號已經發完。

豪擲82億美元,芯片巨頭押注的世界模型究竟是什麼
FoST未來敘事2026.10.01 16:04 · 來自北京全文3694字00:00 / 10:23當AI開始生成“世界”,影音遊內容正在被顛覆。文 | FoST未來敘事,作者 | 蔥蔥82億美元,芯片巨頭AMD以全股票形式收購世界模型公司World Labs。AMD在收購公告裡寫道:“World Labs 的模型經驗,將幫助AMD更深入地理解工作負載如何演變,進而塑造未來的技術路線圖。”換句話說,AMD看中的,不只是World Labs今天的模型能力,更是世界模型這類前沿模型可能給芯片硬件研發帶來的“前瞻性”。

軟銀完成對 OpenAI 最後一筆投資,300 億美元承諾全部到位
作者:潞源 責編:潞源 評論: 10 月 1 日消息,軟銀集團今日表示,公司已通過軟銀願景基金 2 完成對 OpenAI 的第三筆投資,金額為 100 億美元(注:現匯率約合 671.69 億元人民幣),這是軟銀對 OpenAI 的最後一筆投資。