谷歌Gemini跌出全球排名前十

2026年7月22日 19:53
谷歌Gemini跌出全球排名前十

重點摘要

谷歌Gemini系列大模型在第三方評測中跌出全球前十,主因是旗艦版本Gemini 3.5 Pro持續跳票,未能及時推出。谷歌轉而推出三款輕量化模型,專注於商用場景與成本控制,但競爭對手如月之暗面、OpenAI等持續迭代高端模型,壓縮其市場空間。

站內 AI 整理稿

谷歌Gemini跌出全球排名前十

進入2026年,全球頭部大模型賽道競爭愈發白熱化。當地時間7月21日,谷歌旗下DeepMind對外推出三款全新Gemini輕量化模型,包含Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及行業專用模型Gemini 3.5 Flash Cyber,但市場期待已久的旗艦版本Gemini 3.5 Pro沒有如期亮相。據第三方評測榜單數據,谷歌當前主力Gemini系列綜合實力已經跌至全球榜單十名以外,在頭部大模型競速賽道中顯現壓力。根據官方披露的資訊,三款新模型的定位相當明確,主要瞄準規模化商用場景。Gemini 3.

6 Flash作為通用主力輕量模型,在強化多模態理解、工具調用與代碼生成能力的同時,也降低了Token消耗並下調調用定價,相當適合智能體運行、批量文檔處理等高頻應用場景。Gemini 3.5 Flash-Lite則主打超高吞吐與低成本,目標是面向高併發文本摘要、資訊預處理、即時翻譯等對延遲敏感的業務。至於Gemini 3.5 Flash Cyber,則是專為網路安全設計的模型,針對漏洞挖掘與程式碼安全檢測進行定向微調,現階段僅對限定機構開放試點,暫不全面公開發布。今年稍早的谷歌I/O開發者大會上,谷歌執行長桑達爾·皮查伊曾在主題演講中表示,Gemini 3.5 Pro計劃於6月發布。

這款旗艦模型被外界視為谷歌扭轉高端市場劣勢的核心產品,市場普遍預期其將在夏季正式亮相,用來對標OpenAI、Anthropic同期推出的高端模型。然而兩個多月過去,谷歌依舊未能給出明確的上線時間表,僅對外透露模型仍處在封閉合作夥伴測試階段。旗艦機型持續跳票,也讓業界開始審視谷歌在前沿通用大模型研發層面所面臨的瓶頸。第三方評測平台的最新排行榜,清楚展現出谷歌當前的困境。根據AI模型評測平台Arena.ai的數據,Gemini 3.6 Flash在前端程式碼競技場中以1537分排名第12位。國內月之暗面最新發布的Kimi K3以1677分位列榜首,智譜GLM-5.

2排在第四名,Anthropic的Claude和OpenAI的GPT多款系列產品都位居前列。在Artificial Analysis最新智能指數排行榜中,谷歌目前沒有任何一款模型進入前十,這與去年Gemini的情況形成強烈對比。去年11月,谷歌發布Gemini 3模型,曾一度反超OpenAI,在測評中引發業界震動,谷歌股價也隨之飆升。但進入2026年,全球頭部大模型賽道競爭愈發激烈。OpenAI持續迭代GPT高端版本,不斷強化複雜推理與多模態能力;Anthropic則持續更新Claude系列,憑藉長文本和安全性優勢收穫大量企業客戶。

與此同時,Meta、深度求索、月之暗面等國內外廠商持續推出新一代高性能基座模型,不斷向上擠壓排名空間。7月17日凌晨,月之暗面正式發布新一代大模型Kimi K3,該模型參數規模達2.8萬億,擁有100萬token上下文窗口,原生支援視覺理解,月之暗面稱其為「迄今能力最強的模型」。特斯拉執行長馬斯克在相關評測報導下留言「令人印象深刻」表達讚賞,隨後便在社群平台宣布,旗下AI公司正在訓練2萬億參數的新模型,且「可能超越Kimi」。多組橫向盲測數據顯示,現有Gemini主力版本在複雜邏輯推演、長鏈條任務規劃、複雜圖文聯合推理等高難度任務上,與第一梯隊模型已形成可見差距。

部分評測機構指出,谷歌過往依靠先發優勢建立的多模態領先優勢,正在被持續追趕甚至超越。競爭對手不斷縮小多模態能力差距,而谷歌遲遲沒有新一代旗艦產品來補齊性能上限的缺口。本次推出的三款新品都屬於輕量化路線,優勢集中在推理速度與使用成本,但綜合基礎智能的提升幅度有限。市場分析人士指出,榜單排名滑落的背後,是競爭對手普遍維持穩定的高端旗艦迭代節奏,形成了「旗艦開拓性能上限、輕量化版本承接商業化落地」的成熟布局。反觀谷歌,中端Flash系列持續更新,但高端旗艦長期缺位,恐怕會持續侵蝕谷歌在高端企業服務市場的話語權。不過也有分析認為,從商業角度來看,谷歌的策略其實更節省成本。

越來越多公司開始重視AI的投入產出比,大量消耗Token並不一定能帶來最好的結果。谷歌執行長桑達爾·皮查伊也曾表示,如果混合使用Flash模型和其他前沿模型,能節省大量資金。和競爭對手相比,谷歌擁有Android、Chrome、Workspace、搜索、雲端服務等形成的完整產品生態。在產品上不斷壓低成本、提高速度,同時增強模型處理具體任務的能力,而不是單純追逐模型能力和榜單排名,或許是谷歌當前的策略重心。不過,谷歌母公司Alphabet近期在AI領域的大手筆投入並沒有減少。

根據公開財報與投資者溝通資訊,Alphabet已將2026年全年資本支出上調至1800億到1900億美元,規模接近前一年的兩倍,絕大多數資金流向AI算力集群、資料中心擴建與自研晶片研發。今年第一季,公司資本支出達到357億美元,年增幅超過100%。與此同時,谷歌DeepMind也在持續擴充前沿研究團隊,吸納人工智慧領域頂尖人才,並正式啟動下一代Gemini 4基座模型的預訓練工作。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

40 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前