谷歌Gemini 4突然發佈!RSI加持,GPT和Opus都讓讓

假期第一天,谷歌攜Gemini 4 Argon空降多榜單第一。拳打Opus 5.5,腳踢GPT-6 Astra。更誇張的還在後頭,單項任務成本最低可至1.99美元,直接是Astra費用砍半。最高百萬Token輸出上限,面向編程、金融和法律等複雜工作流,而且劃重點,網絡安全防禦能力超牛掰。這波等等黨要贏麻了。不過吧,咱普通用戶現在只可遠觀,暫時還吃不上。Gemini 4 Argon目前只開放給部分經過篩選的網絡安全團隊使用,其它訂閱用戶得一步步來。倒是谷歌內部對新一代旗艦模型的態度還挺有意思的。
劈柴哥、哈薩比斯還有接班人Koray Kavukcuoglu,紛紛一鍵三連為其站臺:谷歌is back!DeepMind研究員Zirui Wang發帖直言: RSI來了!我已做無可做,是時候追逐我的咖啡師夢想了:) 講真?輪到你了,谷歌 全體起立!咱盼星星盼月亮的Gemini 4,它終於來了。仔細數一數,距離谷歌上一代旗艦模型發佈都快一年了,哪吒都沒這麼難產。這一年OpenAI、Anthropic是追著谷歌砍啊,放假前一週還連發Opus 5.5、Sonnet 5.5、GPT-6.1 Sol逼宮。你說谷歌能不急嗎,新型號Argon火速上岸。先看跑分情況,清一色的性能領跑。
Argon在衡量長期軟件工程任務的DeepSWE v1.1上拿到77.9%,高於Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。網絡安全漏洞修復測試CWE-bench v1則拿到68%,和GPT-6 Astra並列第一。Argon以68.90%登頂Vals Index榜首,較Gemini 3.8 Flash實現大幅提升。尤其是RSI指數一躍第四,超越了GPT-6 Astra。Gemini 4 Argon在另外的第三方評測中也不遑多讓。文本領域,Argon在代碼編寫、高難度提示詞、指令遵循、長查詢以及創意寫作賽道優勢顯著,以1525分位居Text Arena第一。
在評測網頁開發的Code Arena中排名第八,較Gemini 3.8 Flash High提升了21個名次,但依舊稍遜於Claude和GPT最新模型。Artificial Analysis測評中,Argon和GPT-6 Astra旗鼓相當,高於GPT-6.1 Sol一分,提升主要來自於更少的幻覺和更強的智能體能力。但在價格上,Argon相比Astra優勢明顯。優惠期間Argon單題成本約低四成,每百萬輸入Token為2美元、輸出Token為10美元,目前是最具性價比的模型之一。在具體工作中,Argon也更傾向於處理複雜且長期的深度推理任務,比如軟件工程、企業專業知識梳理以及網絡安全防禦等。
模型的百萬Token輸出上限,就是為這種長任務準備的,它能給模型更多連續工作的餘地和充足的推理深度。以谷歌內部使用情況為例,其中Argon在谷歌各數據中心自主識別並落地內存優化方案,待方案全面部署後,預計可釋放超300 TiB內存。另一個案例中,Argon Agent圍繞視頻解碼器的Rust移植版本,反覆實驗並替換了3.2萬行SIMD代碼,最終版本運行速度達到原Rust移植版的2.7倍。官方還重點強調了Argon的防禦性網絡安全優勢。
它能夠自主發現、驗證並修補20多種語言的關鍵軟件漏洞,在Wiz內部黑箱滲透測試中,模型可以在無源代碼下實時分析網絡系統,高效發現攻擊面、識別漏洞以及生成概念驗證證據。為了防止濫用,Argon首批進入的是谷歌的Fairwind計劃,面向經過審核的網絡安全防禦方。對受信任的防禦團隊,谷歌會放開針對網絡安全任務的部分限制,Argon將幫助防守方補洞,以及用來尋找攻擊入口。One More Thing 不過嘴上說說得了,Argon實際跑起來怎麼樣,還得打個問號。畢竟咱普羅大眾還沒用上啊喂。。。有小道消息透露,谷歌內部員工對Gemini 4並不完全看好。
一些接觸過Gemini 4的員工認為,模型在實際編程任務中並沒有跑分那麼亮眼,網頁和應用的前端界面設計仍是短板,甚至存在過度刷榜的嫌疑。然而另一名熟悉開發工作的員工則表示,內部普遍認為Gemini 4已達到前沿水平。谷歌也回應稱,說它編程表現不佳並不準確。總之模型到底咋樣,還有待觀察。所幸的是,谷歌終於回到了牌桌之上。參考鏈接:[1] https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/[2] https://www.bloomberg.
com/news/articles/2026-09-30/google-grapples-with-employee-skepticism-about-new-gemini-model[3] https://x.com/MrZiruiWang/status/2105388591644131582[4] https://x.com/arena/status/2105394855644139908[5] https://x.com/ArtificialAnlys/status/2105392625788637299 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

何愷明團隊新作:看貓片就能學會ARC挑戰
何愷明團隊提出NAT-ARC,一種純視覺的ARC解題方案,不依賴語言模型,而是使用ImageNet上的自然圖像進行MAE預訓練,再遷移到抽象格子推理任務。該方法在ARC-1上達到63.4%的單模型pass@2分數,集成後提升至70.2%,逼近專用LLM系統的表現,並證明了視覺預訓練能有效破解抽象推理的scaling瓶頸。

階躍星辰“第一梯隊”,是“自嗨”嗎?
AIX財經2026.10.01 18:22 · 來自福建全文5252字00:00 / 15:27同行各自跑出了主線,階躍的“全棧”能跑通嗎?文 | AIX財經,作者|雷晶,編輯|魏佳沉寂許久的階躍星辰,正試圖擠進大模型第一梯隊。9月20日,它發佈Step 5 Preview,原生支持文本與視覺輸入,重點面向編程、軟件工程、專業知識工作和長程Agent任務。上線初期,登錄並完成首次調用後可獲得30天的Step Plan免費使用權。幾天後,Step Plan的月度套餐一度售罄。

騰訊經銷、字節駐場、Kimi借船:FDE成了大模型的新成本?
新立場Pro2026.10.01 16:16 · 來自四川全文5421字00:00 / 16:08AI公司活成了它們最討厭的樣子。文 | 新立場Pro今年 3 月 6 日上午十點,深圳騰訊大廈樓下開始排隊。人們帶著電腦,等騰訊雲工程師幫自己安裝 OpenClaw,首批八十多人在十點開始排隊,到十一點,數百個預約號已經發完。

谷歌推出了個“做題家”:Gemini 4 Argon屠榜,但幹活差點意思
字母AI2026.10.01 16:16 · 來自北京全文3510字00:00 / 09:31消失10個月的谷歌,為什麼連Pro這塊招牌都扔了?文 | 字母AIGemini 4可算來了,連名字也換了:這次的旗艦不叫Pro,叫Argon。從谷歌公佈的成績看,Gemini 4 Argon在知識工作方面表現搶眼,多項測試超過了OpenAI和Anthropic的旗艦模型。它主打一個知識面廣,從金融、法律到數學、科學,都有不錯的表現。谷歌還確認,9月15日在LMArena上亮相、表現接近GPT-6 Astra的“3.

豪擲82億美元,芯片巨頭押注的世界模型究竟是什麼
FoST未來敘事2026.10.01 16:04 · 來自北京全文3694字00:00 / 10:23當AI開始生成“世界”,影音遊內容正在被顛覆。文 | FoST未來敘事,作者 | 蔥蔥82億美元,芯片巨頭AMD以全股票形式收購世界模型公司World Labs。AMD在收購公告裡寫道:“World Labs 的模型經驗,將幫助AMD更深入地理解工作負載如何演變,進而塑造未來的技術路線圖。”換句話說,AMD看中的,不只是World Labs今天的模型能力,更是世界模型這類前沿模型可能給芯片硬件研發帶來的“前瞻性”。

軟銀完成對 OpenAI 最後一筆投資,300 億美元承諾全部到位
作者:潞源 責編:潞源 評論: 10 月 1 日消息,軟銀集團今日表示,公司已通過軟銀願景基金 2 完成對 OpenAI 的第三筆投資,金額為 100 億美元(注:現匯率約合 671.69 億元人民幣),這是軟銀對 OpenAI 的最後一筆投資。