谷歌推出 Gemini 4 Argon 旗艦 AI 模型,消息稱其實戰性能遭員工質疑

作者:遠洋 責編:遠洋 評論: 10 月 1 日消息,據彭博社報道,Alphabet 公司旗下的谷歌已經開始逐步推出備受期待的旗艦人工智能模型 Gemini 4 Argon,但這家企業內部對於該模型在代碼編寫等核心領域的實際表現尚存質疑。谷歌於當地時間週三向一小批經過篩選、值得信任的網絡安全合作伙伴開放了這款模型,並表示會在完成更多測試之後擴大開放範圍,優先面向付費訂閱用戶。谷歌稱,Gemini 4 在多項基準測試當中取得了靠前的得分,其中一項衡量安全能力的測試成績甚至超越了 OpenAI 的 Astra 模型。不過部分內部員工表示,這些評測指標並不能反映全部情況。
幾位直接參與該項目的知情人士透露,儘管 Gemini 4 在廣為使用的模型效果基準測試上成績不錯,但當谷歌員工實際拿它開展工作時,表現卻不盡如人意。這些不願具名、談論內部事務的人士稱,該模型處理部分代碼任務時會遇到困難。谷歌發佈上述消息之後,Alphabet 公司的盤後股價上漲約 1.7%。而在常規交易日臨近收盤時,隨著彭博社報道出員工對該模型的質疑,週三早些時候的漲幅又出現回落。近期谷歌一直在努力研發模型,希望能夠同 OpenAI 以及 Anthropic 展開競爭。知情人士稱,該公司原本計劃在六月份發佈另一款版本,即 Gemini 3.5 Pro,但之後放棄了這一開發工作。
谷歌方面表示,所謂 Gemini 4 在代碼等領域表現不佳的說法並不準確。公司將彭博社的問詢引向谷歌 DeepMind 負責人科拉伊 · 卡武庫奧盧(Koray Kavukcuoglu)上週發表的表態;他當時稱自己對這款模型的性能感到鼓舞。“我對這支團隊抱有十足的信心。”卡武庫奧盧在科技新聞網站《The Information》主辦的一場會議上說,“在我看來,我們必將持續站在技術最前沿,這是確定無疑的。”谷歌內部對此的看法存在分歧。一部分員工認為,Anthropic 的 Fable 與 OpenAI 的 Astra 模型迭代提升的速度已經超過 Gemini。
在這些人看來,就算 Gemini 4 發揮出最佳水準,依舊會在部分領域落後於競品。另有一部分員工則認為,這款即將上線的新版本已經追上領先的人工智能實驗室。一名熟悉模型研發工作的谷歌員工表示,公司內部已經“形成廣泛共識”,認為 Gemini 4 處於行業前沿水平。這名人士稱谷歌已經針對該模型開展了嚴苛測試,否認該模型難以應對現實當中雜亂複雜的編碼任務。谷歌迫切需要 Gemini 4 取得成功。幾乎谷歌旗下所有產品都以該系列模型作為底層支撐:既包括谷歌最主要的盈利業務搜索頁面頂部給出的人工智能回答,也涵蓋地圖、郵箱以及瀏覽器 Chrome。
上述每一款產品的用戶規模都超過十億,這是不少競爭對手並不具備的分發優勢。但 OpenAI 與 Anthropic 已經不再僅僅售賣模型,轉而著手打造自有產品,其中就包括編程智能體。如果谷歌拿不出一款頂尖的新一代模型,競爭對手就會獲得更多機會,去說服普通消費者、開發者以及各類企業,讓他們相信未來的搜索與軟件應當搭建在對手的平臺之上。在回覆彭博社的提問時谷歌表示,儘管上一代 Pro 模型還是在二月份發佈,但此後谷歌旗下人工智能相關產品依舊保持增長,其中包括面向企業版本的 Gemini、面向普通用戶的聊天機器人應用,以及谷歌搜索當中的人工智能模式;後兩項產品的用戶數量都已經突破十億。
Gemini 3去年 11 月,谷歌正式推出了 Gemini 3。這款模型收穫不錯的評價,外界普遍認為這是谷歌奮力追趕 OpenAI 與 Anthropic 過程當中的一個轉折點。谷歌在五月份的開發者大會 I/O 上對外公佈新一代迭代版本 Gemini 3.5 Pro,並承諾於次月正式發佈。然而原定的發佈期限已經過去,知情人士稱谷歌後續直接擱置了 Gemini 3.5 Pro 項目。放棄該項目不光阻礙谷歌的人工智能發展規劃,還很可能讓公司付出高昂的時間與資金代價。
彭博行業研究分析師曼迪普 · 辛格(Mandeep Singh)提出,訓練開發這一級別的大模型單次訓練運行開銷最高可達 4 億美元(注:現匯率約合 26.87 億元人民幣);再加上高薪人工智能研究人員的人力投入,整體成本還會進一步走高。如今 Gemini 4 的研發又接連遇到各類難題。熟悉內部評估工作的人士透露,該模型的代碼編寫能力參差不齊。其中一位知情人員表示,Gemini 並不擅長前端設計,也就是決定應用程序與網頁外觀和交互體驗的相關工作。這有可能成為一次嚴重挫折,因為谷歌在競爭激烈的人工智能代碼工具賽道本就處於追趕位置。除此之外,知情研發人員稱它本身屬於體量非常龐大的模型。
大型模型的運行成本通常居高不下,這或許會給谷歌的利潤空間帶來壓力。“基準跑分內卷(Benchmaxxing)”業內專家表示,谷歌或許正陷入整個行業的通病:過度看重基準測試得分,也就是所謂的“基準跑分內卷”現象。工程師會投入更多精力刷出好看的測試分數,而非開發一款可以切實把任務做好的產品。各家人工智能實驗室容易出現這種傾向,畢竟客戶往往依靠基準分數評判模型優劣。兩位熟悉該模型的人士表示,Gemini 4 似乎也受到這一問題的影響。
人工智能初創企業 Surge AI 創始人埃德溫 · 陳(Edwin Chen)提出,如果一味依賴基準測試,實驗室就會傾向於專門針對特定編程語言優化模型的代碼能力,而不是去開發體驗良好、設計完善的應用。“可以打個比方:‘沒錯,我的孩子 SAT 考試分數很高。’可是 SAT 高分並不等同於現實當中的實際能力。”埃德溫 · 陳說,“這是一個危害極大的問題。”知情人士同時也指出,Gemini 4 本身依然具備優勢。該模型擅長解析文本以外形式的輸入內容,例如從視頻當中提取元數據;另外它在安全防護、網絡安全方面表現突出,輸出內容的溝通表達清晰自然。谷歌內部的挫敗情緒已經十分明顯。
此前彭博社一篇報道在採訪研究人員時,對方就批評公司體系龐大、層級繁雜,試圖把人工智能技術強行嵌入谷歌幾乎全部產品線;不斷變動的任務目標與優先級調整,導致企業很難落實一套連貫統一的發展策略。與此同時,一批頂尖人工智能研究人員相繼離開谷歌,其中包括傳奇工程師傑夫 · 迪恩(Jeff Dean)、諾貝爾獎得主約翰 · 江珀(John Jumper),還有諾阿姆 · 沙澤爾(Noam Shazeer)—— 他參與發明的底層技術,正是本輪人工智能熱潮的重要基石。
今年八月,長期主管谷歌人工智能研究工作的德米斯 · 哈薩比斯(Demis Hassabis)轉任董事長一職,將 DeepMind 部門的日常運營工作移交給他長期的副手科拉伊 · 卡武庫奧盧。谷歌於週三對外說明,Gemini 4 面向軟件工程、金融、法律以及網絡安全領域時長較長、複雜度高的工作任務而設計。該模型相比前代版本可以生成更長的回覆,單次輸出最高可達一百萬詞元(token),大約相當於七十五萬個單詞。就在谷歌奮力追趕的同時,競爭對手依舊在高速向前推進。
儘管接連發生多起 AI 智能體入侵外部機構的事件,已經有觀點認為部分前沿模型的研發速度會有所放緩;就在本月早些時候,Meta 平臺公司發佈了 Muse 這款 AI 智能體產品,官方稱它可以獨立完成網購、預約等日常事務。這款應用上線之後迅速登上應用下載榜單前列。
投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:谷歌,人工智能,Gemini 4谷歌確認新一代旗艦模型 Gemini 4 即將推出,或不用等到年底谷歌 DeepMind 前員工警告:AI 有能力滅絕人類,留給我們的時間已不多谷歌雲:兩年即可回收 AI 服務器投資,自研芯片回收期僅為 GPU 一半谷歌計劃在芬蘭投入至少 130 億歐元用於 AI 基建,為其在歐洲最大單筆投資消息稱谷歌已擱置發佈 Gemini 3.5 Pro AI 模型消息稱谷歌洽談超 15 億美元交易,擬吸納 AI 編程初創公司 Mechanize 人才並獲取技術授權
Related
相關文章

何愷明團隊新作:看貓片就能學會ARC挑戰
何愷明團隊提出NAT-ARC,一種純視覺的ARC解題方案,不依賴語言模型,而是使用ImageNet上的自然圖像進行MAE預訓練,再遷移到抽象格子推理任務。該方法在ARC-1上達到63.4%的單模型pass@2分數,集成後提升至70.2%,逼近專用LLM系統的表現,並證明了視覺預訓練能有效破解抽象推理的scaling瓶頸。

谷歌Gemini 4突然發佈!RSI加持,GPT和Opus都讓讓
。。。 假期第一天,谷歌攜Gemini 4 Argon空降多榜單第一。 拳打Opus 5.5,腳踢GPT-6 Astra。 更誇張的還在後頭,單項任務成本最低可至1.99美元,直接是Astra費用砍半。 最高百萬Token輸出上限,面向編程、金融和法律等複雜工作流,而且劃重點,網絡安全防禦能力超牛掰。 這波等等黨要贏麻了。 不過吧,咱普通用戶現在只可遠觀,暫時還吃不上。

階躍星辰“第一梯隊”,是“自嗨”嗎?
AIX財經2026.10.01 18:22 · 來自福建全文5252字00:00 / 15:27同行各自跑出了主線,階躍的“全棧”能跑通嗎?文 | AIX財經,作者|雷晶,編輯|魏佳沉寂許久的階躍星辰,正試圖擠進大模型第一梯隊。9月20日,它發佈Step 5 Preview,原生支持文本與視覺輸入,重點面向編程、軟件工程、專業知識工作和長程Agent任務。上線初期,登錄並完成首次調用後可獲得30天的Step Plan免費使用權。幾天後,Step Plan的月度套餐一度售罄。

騰訊經銷、字節駐場、Kimi借船:FDE成了大模型的新成本?
新立場Pro2026.10.01 16:16 · 來自四川全文5421字00:00 / 16:08AI公司活成了它們最討厭的樣子。文 | 新立場Pro今年 3 月 6 日上午十點,深圳騰訊大廈樓下開始排隊。人們帶著電腦,等騰訊雲工程師幫自己安裝 OpenClaw,首批八十多人在十點開始排隊,到十一點,數百個預約號已經發完。

谷歌推出了個“做題家”:Gemini 4 Argon屠榜,但幹活差點意思
字母AI2026.10.01 16:16 · 來自北京全文3510字00:00 / 09:31消失10個月的谷歌,為什麼連Pro這塊招牌都扔了?文 | 字母AIGemini 4可算來了,連名字也換了:這次的旗艦不叫Pro,叫Argon。從谷歌公佈的成績看,Gemini 4 Argon在知識工作方面表現搶眼,多項測試超過了OpenAI和Anthropic的旗艦模型。它主打一個知識面廣,從金融、法律到數學、科學,都有不錯的表現。谷歌還確認,9月15日在LMArena上亮相、表現接近GPT-6 Astra的“3.

豪擲82億美元,芯片巨頭押注的世界模型究竟是什麼
FoST未來敘事2026.10.01 16:04 · 來自北京全文3694字00:00 / 10:23當AI開始生成“世界”,影音遊內容正在被顛覆。文 | FoST未來敘事,作者 | 蔥蔥82億美元,芯片巨頭AMD以全股票形式收購世界模型公司World Labs。AMD在收購公告裡寫道:“World Labs 的模型經驗,將幫助AMD更深入地理解工作負載如何演變,進而塑造未來的技術路線圖。”換句話說,AMD看中的,不只是World Labs今天的模型能力,更是世界模型這類前沿模型可能給芯片硬件研發帶來的“前瞻性”。