領導層洗牌後,Argon能否助谷歌重回前沿?

2026年10月2日 09:31
領導層洗牌後,Argon能否助谷歌重回前沿?
站內 AI 整理稿

影子備忘錄2026.10.02 09:29 · 來自廣東全文5137字00:00 / 13:38谷歌AI的一場豪賭文 | 影子備忘錄2026年的AI賽道,用“瞬息萬變”來形容已經遠遠不夠。如果你每隔兩週沒有關注前沿模型的動態,打開排行榜時大概率會懷疑自己是不是錯過了整整一個季度。就在這樣近乎瘋狂的產品迭代節奏中,谷歌DeepMind於9月30日正式發佈了Gemini 4系列的首款旗艦模型Argon。距離上一代旗艦Gemini 3系列亮相,已經過去了將近十個月。對於一個頭部AI實驗室來說,十個月的沉默幾乎等同於一次豪賭。

但在討論Argon之前,有一個更值得回看的背景,然而這場豪賭的籌碼,其實在兩個月前就已經被重新洗過一遍了。一場“靜悄悄的權力交接”2026年8月5日,Alphabet CEO桑達爾·皮查伊通過內部信宣佈了一項令業界震動的架構調整:Google DeepMind聯合創始人兼CEO德米斯·哈薩比斯卸下日常運營管理職責,轉任DeepMind董事長及Alphabet首席科學家。首席技術官科雷·卡武克丘奧盧升任DeepMind高級副總裁,直接向皮查伊彙報。而在這家公司工作了27年的首席科學家傑夫·迪恩,選擇離開谷歌,與老搭檔桑傑·格瑪沃特共同創辦一家獨立的公益企業。

這組信息放在一起看,遠不止幾個人換個頭銜那麼簡單。哈薩比斯是DeepMind的靈魂人物,從AlphaGo到AlphaFold,他的個人品牌幾乎等同於DeepMind的公眾形象。把他從日常管理中“解放”出來,轉而專注AGI長期戰略和前沿科學,釋放的信號非常明確:谷歌希望DeepMind從一家“頂級研究機構”變成一臺“高效產品引擎”。卡武克丘奧盧是深度學習的實幹派,在DeepMind工作13年,從組建深度學習團隊到主導WaveNet和DQN等突破,其履歷橫跨研究與工程兩端。讓他掌舵日常運營,本質上是把“交付能力”提到了比“探索自由度”更高的優先級上。更值得注意的是這次調整的空間維度。

多家媒體分析指出,權力正在從倫敦向加州轉移,谷歌聯合創始人謝爾蓋·布林的影響力也在迴歸。這意味著DeepMind正在被更深地整合進谷歌的全球產品體系,而不是作為一座“研究飛地”獨立運轉。對於一個需要在搜索、地圖、Gmail、Chrome等十億級用戶產品中落地AI能力的公司來說,這種整合是必然的,但代價是DeepMind失去了相當程度的自主權。Argon的牌面理解了這次架構調整的底層邏輯,再來看Argon的表現,就能讀出更多東西。從紙面數據看,谷歌官方在19項基準測試中宣稱Argon取得了13項領先,涵蓋長週期軟件工程、企業知識工作、網絡安全漏洞修復等多個維度。

在衡量真實世界長期軟件工程能力的DeepSWE v1.1測試中,Argon拿到了77.9%,超過了Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。在Zapier的AutomationBench——這個衡量企業端到端業務流程自動化執行能力的基準上,Argon以51.3%排名第一,比Claude Opus 5.5高出近9個百分點。但Argon真正讓人側目的,不是某個單獨的跑分數字,而是它把輸出Token上限從上一代的6.4萬直接拉到了100萬。輸出上限和上下文窗口是兩個完全不同的概念,前者決定的是模型在一次推理軌跡中能生成多長的內容。

100萬Token的輸出意味著模型可以在單次任務中持續推理、生成接近百萬Token的結果,而不是被迫把複雜任務拆成好幾輪來做。這對大型代碼庫遷移、深度研究、多步驟企業流程這類場景的意義是結構性的。實際落地的案例也在印證這一點。谷歌披露,Argon已經參與了內部C/C++代碼庫向Rust的遷移工作,覆蓋超過80萬行代碼的Fuchsia Zircon內核。在開源視頻解碼器libgav1項目中,Argon通過多輪性能測試和編譯器分析,重寫了約3.2萬行SIMD代碼,新的Rust版本運行速度達到原版本的2.7倍。這些不是demo級別的展示,而是進入了谷歌核心基礎設施的真實工程任務。

定價方面,Argon的推廣期價格是每百萬輸入Token 2美元、每百萬輸出Token 10美元,緩存輸入的價格更是比標準輸入低了95%。根據Artificial Analysis的測算,在折扣價下,Argon完成單個任務的成本約為1.99美元,比GPT-6 Astra低了約40%。這個價格策略的進攻性非常明顯,谷歌是在告訴企業客戶:你不一定需要最強的模型,但你一定需要性價比最高的那個。跑分之外,裂縫同樣清晰Argon的問題和它的亮點一樣突出,而且這些問題恰恰暴露了谷歌在AI戰略上的深層矛盾。首先,Argon並非在所有維度上都領先。

在FrontierSWE v2和Terminal-Bench Science 0.1這兩個終端和科學推理相關的測試中,GPT-6 Astra領先Argon超過10個百分點;在Terminal-bench 4.0上,Claude Opus 5.5以66.4%大幅領先Argon的57.4%。The Decoder的評論更是一針見血:Argon“縮小了與OpenAI和Anthropic的差距,但並未取得明顯領先”。另外,彭博社在Argon發佈當天報道稱,部分谷歌員工對該模型在實際編程工作中的表現存在質疑。

據知情人士透露,儘管Argon在標準基準測試上成績不錯,但當員工真正將其用於日常編碼任務時,表現並不盡如人意,尤其是在前端設計等領域存在明顯短板。這種“跑分亮眼、實戰存疑”的落差,引發了外界對谷歌是否存在“benchmaxxing”(為跑分而優化)的質疑。這裡面有一個容易被忽略的技術細節。Argon在DeepSWE v1.1上拿到77.9%的高分,但在更接近真實工程複雜度的FrontierSWE v2上只有55.0%,被GPT-6 Astra的65.5%拉開了超過10個百分點。

兩個測試的核心差異在於任務鏈條的長度和環境的不確定性,即前者在相對結構化的條件下評估代碼生成能力,後者更接近開發者在實際項目中面對的混亂狀態。這個差距指向一個可能性:Argon在受控環境中的表現出色,但面對真實世界中模糊的需求、不完整的代碼上下文和跨模塊依賴時,能力衰減比競品更明顯。這恰好解釋了為什麼谷歌選擇分階段發佈。Argon目前僅通過Fairwind計劃向受信任的網絡安全防禦者開放,普通開發者和消費者還需要等待。谷歌的官方說法是需要進一步加固安全防護,但這個理由背後可能還有一層考量:先在小範圍內收集真實場景反饋,用實際使用數據來校準模型在非受控環境中的表現。

部分開發者對此表達了不滿,有人在社交平臺上直言:“跑分是領先了,但普通開發者連API都用不上,又要排隊。”掉隊的谷歌,追趕的代價要客觀評估Argon能否幫谷歌“重回前沿”,需要先理解谷歌是怎麼“掉隊”的。2025年11月,Gemini 3發佈後收穫了不錯的評價,一度被認為是谷歌追趕OpenAI和Anthropic的轉折點。2026年5月的I/O開發者大會上,谷歌公佈了迭代版本Gemini 3.5 Pro,並承諾6月正式發佈,然而這個承諾從未兌現。據多家媒體報道,Gemini 3.5 Pro的訓練週期超出預期但結果不理想,項目最終被擱置。

有分析師估算,這一級別的大模型單次訓練運行的開銷最高可達4億美元。一次失敗的訓練不僅意味著金錢和時間的損失,更意味著在競爭對手加速迭代的窗口期內,谷歌被迫按下了暫停鍵。與此同時,2026年的競爭格局呈現出前所未有的膠著態勢。年初Anthropic憑藉極致的智能體產品架構和編程能力實現反超;第二季度OpenAI通過限量發佈GPT-5.5、GPT-5.6系列重新奪回制高點。7月Anthropic又推出Claude Sonnet 5,號稱“最具代理能力”的中端模型。到9月下旬,Anthropic發佈Claude Opus 5.5,常規負載成本比上一代下降40%,輸出速度提升超過30%。

各大巨頭交替領先,沒有任何一方能保持超過一個季度的優勢。在這個背景下審視Argon,它更像是谷歌在經歷了一次代價高昂的“跳票”之後,用一次架構重組和一款新模型發起的雙重反擊。但反擊的效果,取決於一個比跑分更根本的問題:谷歌是否找到了適合自己的競爭策略?不過谷歌有一個其他競爭對手不具備的優勢,那就是它擁有超過十億用戶的產品矩陣。Gemini模型支撐著搜索頁面的AI回答、谷歌地圖、Gmail和Chrome,Gemini應用月活用戶已突破9.5億。這種分發能力意味著,即使模型本身不是絕對最強,谷歌也能讓AI能力觸達比任何競爭對手都多的用戶。

但問題在於,分發優勢只有在模型“夠好”的時候才能轉化為競爭力。如果用戶在使用谷歌搜索的AI回答時覺得不如ChatGPT準確,在使用Gemini應用時覺得不如Claude順手,那麼龐大的用戶基數反而會加速負面口碑的傳播。OpenAI和Anthropic已經不再僅僅出售模型,而是越來越多地打造自有產品和編程智能體。如果谷歌拿不出一款頂尖的新一代模型,競爭對手就會獲得更多機會去說服消費者和開發者,讓他們相信未來的搜索和軟件應該搭建在競爭對手的平臺上。Argon的策略選擇很有意思:它沒有追求“全能冠軍”,而是把資源集中在企業知識工作、軟件工程和網絡安全這三個高價值場景上。

這或許反映了一個務實的判斷,也就是在通用能力上全面碾壓對手的窗口期可能已經過去了,與其追求面面俱到,不如在幾個關鍵戰場上打出差異化。Argon在網絡安全方面的表現尤其值得關注。在CWE-bench v1漏洞修復評測中,Argon以68%的成績並列第一。更具體地說,谷歌稱Argon曾發現一項影響全球醫院所用醫療軟件的嚴重漏洞,而此前的前沿模型未能識別出這一風險。在網絡安全這個領域,“發現別人發現不了的漏洞”比“跑分高几個百分點”有說服力得多。定價策略同樣體現了務實的轉向。過去幾個月,谷歌的對外溝通重心已經從“展示Gemini的尖端能力”轉向“強調與競品相比的成本優勢”。

這是一個信號:在模型能力差距縮小到幾個百分點的當下,谷歌選擇用性價比來爭奪開發者生態和企業客戶。回到牌桌上的前提Argon的發佈,至少證明了三件事:谷歌仍然具備訓練前沿級別模型的能力;新的管理架構能夠在相對短的時間內交付產品;谷歌在網絡安全等垂直場景中找到了差異化的切入角度。但Argon也暴露了谷歌尚未解決的問題。內部對模型實戰能力的爭議、在部分關鍵基準上的落後、以及“先給少數人用”的分階段策略,都說明Argon不是一個“一錘定音”的產品。它更像是一張入場券,看似讓谷歌重新回到了前沿模型競爭的第一梯隊,但距離“重回前沿”還有相當的距離。AI行業的迭代速度已經快到令人窒息的程度。

從ChatGPT上線至今,OpenAI和Anthropic已經累計發佈了超過40個重磅模型,平均每6天就有一個新旗艦誕生。在這個節奏下,任何一款模型的技術領先窗口都極其短暫。Argon今天在DeepSWE上的77.9%可能下週就會被刷新,Vals Index上的領先可能下個月就會被反超。谷歌真正的考驗不在發佈日,而在發佈之後。Argon能否在真實開發者的工作流中證明自己,能否在安全護欄加固後順利開放給更廣泛的用戶群體,能否在下一輪競爭中以更快的節奏交付迭代……這些問題的答案,不取決於谷歌的官方博客怎麼寫,也不取決於基準測試的數字有多好看,而是取決於市場會給出最終的判斷。

不過市場的耐心,從來都是有限度的。

Related

相關文章

鈦媒體生成式AI

deepseek為什麼要在此時擁抱華為?

影子備忘錄2026.10.02 09:56 · 來自廣東全文4161字00:00 / 11:24這不是一次適配,這是一次搬家。文 | 影子備忘錄國慶假期前一天,DeepSeek放出了一條一則消息:正式開源面向華為昇騰算力平臺的基礎設施組件,涵蓋TileLang高級語言編譯工具、高性能計算庫與分佈式通信庫,所有組件與此前面向英偉達平臺的開源組件一一對應。如果你只把這當作一次普通的“國產適配”,那可能會錯過這件事真正的分量。

剛剛
IT之家生成式AI

騰訊 WorkBuddy:Hy4 preview 夜間限免、Hy3 限免延期至 10 月 31 日

作者:沁滄(實習) 責編:沁滄 評論: 10 月 2 日消息,騰訊 WorkBuddy 於 9 月 30 日晚宣佈,決定將 Hy3 模型限免及 Hy4 preview 模型夜間限免均延期至 10 月 31 日。如果用戶已經體驗過 Hy4 preview —— WorkBuddy 在閒時夜間 (23:00 - 次日 8:00) 繼續提供免費體驗 Hy4 preview 的模型額度,截止 10 月 31 日,其餘時間正常消耗積分使用。

剛剛
量子位生成式AI

何愷明團隊新作:看貓片就能學會ARC挑戰

何愷明團隊提出NAT-ARC,一種純視覺的ARC解題方案,不依賴語言模型,而是使用ImageNet上的自然圖像進行MAE預訓練,再遷移到抽象格子推理任務。該方法在ARC-1上達到63.4%的單模型pass@2分數,集成後提升至70.2%,逼近專用LLM系統的表現,並證明了視覺預訓練能有效破解抽象推理的scaling瓶頸。

4 小時前
量子位生成式AI

谷歌Gemini 4突然發佈!RSI加持,GPT和Opus都讓讓

。。。 假期第一天,谷歌攜Gemini 4 Argon空降多榜單第一。 拳打Opus 5.5,腳踢GPT-6 Astra。 更誇張的還在後頭,單項任務成本最低可至1.99美元,直接是Astra費用砍半。 最高百萬Token輸出上限,面向編程、金融和法律等複雜工作流,而且劃重點,網絡安全防禦能力超牛掰。 這波等等黨要贏麻了。 不過吧,咱普通用戶現在只可遠觀,暫時還吃不上。

4 小時前
鈦媒體生成式AI

階躍星辰“第一梯隊”,是“自嗨”嗎?

AIX財經2026.10.01 18:22 · 來自福建全文5252字00:00 / 15:27同行各自跑出了主線,階躍的“全棧”能跑通嗎?文 | AIX財經,作者|雷晶,編輯|魏佳沉寂許久的階躍星辰,正試圖擠進大模型第一梯隊。9月20日,它發佈Step 5 Preview,原生支持文本與視覺輸入,重點面向編程、軟件工程、專業知識工作和長程Agent任務。上線初期,登錄並完成首次調用後可獲得30天的Step Plan免費使用權。幾天後,Step Plan的月度套餐一度售罄。

9 小時前