谷歌Gemini跌出全球排名前十

重點摘要
谷歌Gemini系列大模型在第三方評測中跌出全球前十,主因是旗艦版本Gemini 3.5 Pro持續跳票,未能及時推出。谷歌轉而推出三款輕量化模型,專注於商用場景與成本控制,但競爭對手如月之暗面、OpenAI等持續迭代高端模型,壓縮其市場空間。
谷歌Gemini跌出全球排名前十
進入2026年,全球頭部大模型賽道競爭愈發白熱化。當地時間7月21日,谷歌旗下DeepMind對外推出三款全新Gemini輕量化模型,包含Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及行業專用模型Gemini 3.5 Flash Cyber,但市場期待已久的旗艦版本Gemini 3.5 Pro沒有如期亮相。據第三方評測榜單數據,谷歌當前主力Gemini系列綜合實力已經跌至全球榜單十名以外,在頭部大模型競速賽道中顯現壓力。根據官方披露的資訊,三款新模型的定位相當明確,主要瞄準規模化商用場景。Gemini 3.
6 Flash作為通用主力輕量模型,在強化多模態理解、工具調用與代碼生成能力的同時,也降低了Token消耗並下調調用定價,相當適合智能體運行、批量文檔處理等高頻應用場景。Gemini 3.5 Flash-Lite則主打超高吞吐與低成本,目標是面向高併發文本摘要、資訊預處理、即時翻譯等對延遲敏感的業務。至於Gemini 3.5 Flash Cyber,則是專為網路安全設計的模型,針對漏洞挖掘與程式碼安全檢測進行定向微調,現階段僅對限定機構開放試點,暫不全面公開發布。今年稍早的谷歌I/O開發者大會上,谷歌執行長桑達爾·皮查伊曾在主題演講中表示,Gemini 3.5 Pro計劃於6月發布。
這款旗艦模型被外界視為谷歌扭轉高端市場劣勢的核心產品,市場普遍預期其將在夏季正式亮相,用來對標OpenAI、Anthropic同期推出的高端模型。然而兩個多月過去,谷歌依舊未能給出明確的上線時間表,僅對外透露模型仍處在封閉合作夥伴測試階段。旗艦機型持續跳票,也讓業界開始審視谷歌在前沿通用大模型研發層面所面臨的瓶頸。第三方評測平台的最新排行榜,清楚展現出谷歌當前的困境。根據AI模型評測平台Arena.ai的數據,Gemini 3.6 Flash在前端程式碼競技場中以1537分排名第12位。國內月之暗面最新發布的Kimi K3以1677分位列榜首,智譜GLM-5.
2排在第四名,Anthropic的Claude和OpenAI的GPT多款系列產品都位居前列。在Artificial Analysis最新智能指數排行榜中,谷歌目前沒有任何一款模型進入前十,這與去年Gemini的情況形成強烈對比。去年11月,谷歌發布Gemini 3模型,曾一度反超OpenAI,在測評中引發業界震動,谷歌股價也隨之飆升。但進入2026年,全球頭部大模型賽道競爭愈發激烈。OpenAI持續迭代GPT高端版本,不斷強化複雜推理與多模態能力;Anthropic則持續更新Claude系列,憑藉長文本和安全性優勢收穫大量企業客戶。
與此同時,Meta、深度求索、月之暗面等國內外廠商持續推出新一代高性能基座模型,不斷向上擠壓排名空間。7月17日凌晨,月之暗面正式發布新一代大模型Kimi K3,該模型參數規模達2.8萬億,擁有100萬token上下文窗口,原生支援視覺理解,月之暗面稱其為「迄今能力最強的模型」。特斯拉執行長馬斯克在相關評測報導下留言「令人印象深刻」表達讚賞,隨後便在社群平台宣布,旗下AI公司正在訓練2萬億參數的新模型,且「可能超越Kimi」。多組橫向盲測數據顯示,現有Gemini主力版本在複雜邏輯推演、長鏈條任務規劃、複雜圖文聯合推理等高難度任務上,與第一梯隊模型已形成可見差距。
部分評測機構指出,谷歌過往依靠先發優勢建立的多模態領先優勢,正在被持續追趕甚至超越。競爭對手不斷縮小多模態能力差距,而谷歌遲遲沒有新一代旗艦產品來補齊性能上限的缺口。本次推出的三款新品都屬於輕量化路線,優勢集中在推理速度與使用成本,但綜合基礎智能的提升幅度有限。市場分析人士指出,榜單排名滑落的背後,是競爭對手普遍維持穩定的高端旗艦迭代節奏,形成了「旗艦開拓性能上限、輕量化版本承接商業化落地」的成熟布局。反觀谷歌,中端Flash系列持續更新,但高端旗艦長期缺位,恐怕會持續侵蝕谷歌在高端企業服務市場的話語權。不過也有分析認為,從商業角度來看,谷歌的策略其實更節省成本。
越來越多公司開始重視AI的投入產出比,大量消耗Token並不一定能帶來最好的結果。谷歌執行長桑達爾·皮查伊也曾表示,如果混合使用Flash模型和其他前沿模型,能節省大量資金。和競爭對手相比,谷歌擁有Android、Chrome、Workspace、搜索、雲端服務等形成的完整產品生態。在產品上不斷壓低成本、提高速度,同時增強模型處理具體任務的能力,而不是單純追逐模型能力和榜單排名,或許是谷歌當前的策略重心。不過,谷歌母公司Alphabet近期在AI領域的大手筆投入並沒有減少。
根據公開財報與投資者溝通資訊,Alphabet已將2026年全年資本支出上調至1800億到1900億美元,規模接近前一年的兩倍,絕大多數資金流向AI算力集群、資料中心擴建與自研晶片研發。今年第一季,公司資本支出達到357億美元,年增幅超過100%。與此同時,谷歌DeepMind也在持續擴充前沿研究團隊,吸納人工智慧領域頂尖人才,並正式啟動下一代Gemini 4基座模型的預訓練工作。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。