谷歌「史上最差」AI模型發佈,Gemini 3.5 Pro延期

2026年7月22日 08:29
谷歌「史上最差」AI模型發佈,Gemini 3.5 Pro延期

重點摘要

# 谷歌「史上最差」AI模型發佈,Gemini 3.5 Pro延期引發業界震動 昨夜,谷歌DeepMind突如其來地發佈了三款AI模型,分別為Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。然而,這場原本被寄予厚望的發佈會,卻意外演變成一場公關災難。新模型一經推出便遭到開發者和用戶的強烈批評,被戲稱為谷歌「史上最差」的AI模型,同時備受期待的Gemini 3.5 Pro正式版再度延期,讓外界對谷歌在大模型競賽中的處境感到憂心。

站內 AI 整理稿

# 谷歌「史上最差」AI模型發佈,Gemini 3.5 Pro延期引發業界震動

昨夜,谷歌DeepMind突如其來地發佈了三款AI模型,分別為Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。然而,這場原本被寄予厚望的發佈會,卻意外演變成一場公關災難。新模型一經推出便遭到開發者和用戶的強烈批評,被戲稱為谷歌「史上最差」的AI模型,同時備受期待的Gemini 3.5 Pro正式版再度延期,讓外界對谷歌在大模型競賽中的處境感到憂心。 ## 糟糕至極的初步表現

據悉,Gemini 3.6 Flash在Vertex AI上線後,早期實測結果令人大跌眼鏡。該模型在前端界面生成與空間推理方面的表現極其糟糕,幾乎全面崩盤。在前端代碼競技場中,Gemini 3.6 Flash不僅不敵Claude Fable 5、GPT-5.6 Sol等當紅模型,甚至連Meta的Muse Spark 1.1都未能超越,這一結果令許多開發者感到難以置信。 有開發者使用2-shot測試該模型界面生成能力,結果發現輸出的界面代碼邏輯錯亂,組件嵌套混亂,交互邏輯斷裂,完全無法投入實際使用。「這是我真正見過的最差結果。」一位開發者在社交平台上如此評價,並附上截圖迅速在開發者社區中引發廣泛共鳴。 ## 空間推理能力明顯退步

更令人擔憂的是Gemini 3.6 Flash在空間推理方面的表現。有開發者專門錄製了視頻,逐幀測試該模型在空間關係理解上的表現。結果顯示,模型頻繁出錯,對基礎位置關係和方向判斷的準確率相比上一代3.5 Flash出現明顯退步。即便測試者嘗試開啟「high thinking」高性能模式,結果仍然不盡人意。 另一名網友在使用了高推理強度後表示第一印象不佳:「木紋紋理看起來還行,沒什麼特別之處,大理石近距離看反射效果還不錯,但存在bug。」第二印象甚至更差,在CursorBench上,Gemini 3.6 Flash還不如Cursor的Composer 2.5。 ## 基準測試成績慘淡

即便是谷歌自行發佈的測試結果,也顯示Gemini 3.6 Flash在代碼任務上已被其他模型超越,僅在視覺和上下文基準測試中勉強保持領先。而在第三方綜合測評平台Artificial Analysis上,Gemini 3.6 Flash的得分與3.5 Flash完全相同,整體表現不如Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra等多個競爭對手。 更有網友發現該模型的知識截止日期實際上並未更新到其所聲稱的時間,直指這是一個「未完成的模型」。該模型聲稱知識截止於2026年3月,但測試發現它對2026年甚至2025年的大部分內容一無所知,實際知識似乎停留在2025年1月。 ## 快而無用的Flash-Lite

除了Gemini 3.6 Flash,谷歌還同步發佈了Gemini 3.5 Flash-Lite,主打速度快,每秒可輸出350個token。然而,速度的提升並未帶來用戶的認可,反而引發了更強烈的質疑。「快速給出一個錯誤答案,等於用更高的效率浪費用戶的時間。」有用戶如此批評。更何況,與競爭對手相比,這款模型價格更貴,效果更差,性價比極為低下。 此外,谷歌還發布了網絡安全模型Gemini 3.5 Flash Cyber,但同樣未能在行業內引起正面反響。 ## Gemini 3.5 Pro再度延期

在發佈公告中,谷歌終於承認Gemini 3.5 Pro還沒有完全準備好。與此同時,谷歌透露Gemini 4已開始「目前最雄心勃勃的預訓練」,並對取得的進展感到非常振奮。據CNBC報道,這是谷歌「有史以來規模最大的預訓練項目」。 行業分析人士推測,從目前情況來看,近期3.5 Pro的開發進展並不理想,因此谷歌不得不啟動全新的預訓練課程。這意味著用戶期待已久的下一代旗艦模型,短期內仍無法面世。 ## 業界質疑谷歌戰略失誤

這場發佈會引發的爭議遠不止於模型本身。有用戶諷刺稱,在算力緊缺的時代,DeepMind這種浪費算力發佈邏輯混亂的模型的行為,等同於瀆職,還不如直接將資源轉讓給Moonshot等競爭對手。 這番言論背後,折射出開發者社群對谷歌「版本號遊戲」的深層厭惡。有評論指出,谷歌似乎陷入了某種「官僚主義的指標狂熱」——為了在財報和發佈會上展示更高的版本號和更快的推理速度,犧牲了AI最本質的真實效用。「谷歌這種趕鴨子上架、敗壞口碑的做法到底圖什麼?」成為業界普遍質疑的問題。 ## 谷歌在AGI競賽中的處境堪憂

此次事件引發了一個更深層次的問題:在AGI競賽中,谷歌還能保有一席之地嗎?從原本被視為AI領域的領頭羊,到如今被競爭對手逐一超越,再到發布被稱為「史上最差」的模型,谷歌的AI戰略正面臨嚴峻考驗。 與此同時,其他科技巨頭如OpenAI、Anthropic、Meta以及眾多初創公司正在快速推進各自的大模型研發,紛紛推出更強大的產品。在這種情況下,谷歌如果不能盡快解決模型質量問題,重新贏得開發者信任,其在AI領域的領先地位恐怕將難以維繫。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前