谷歌「史上最差」AI模型發佈,Gemini 3.5 Pro延期

重點摘要
# 谷歌「史上最差」AI模型發佈,Gemini 3.5 Pro延期引發業界震動 昨夜,谷歌DeepMind突如其來地發佈了三款AI模型,分別為Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。然而,這場原本被寄予厚望的發佈會,卻意外演變成一場公關災難。新模型一經推出便遭到開發者和用戶的強烈批評,被戲稱為谷歌「史上最差」的AI模型,同時備受期待的Gemini 3.5 Pro正式版再度延期,讓外界對谷歌在大模型競賽中的處境感到憂心。
# 谷歌「史上最差」AI模型發佈,Gemini 3.5 Pro延期引發業界震動
昨夜,谷歌DeepMind突如其來地發佈了三款AI模型,分別為Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。然而,這場原本被寄予厚望的發佈會,卻意外演變成一場公關災難。新模型一經推出便遭到開發者和用戶的強烈批評,被戲稱為谷歌「史上最差」的AI模型,同時備受期待的Gemini 3.5 Pro正式版再度延期,讓外界對谷歌在大模型競賽中的處境感到憂心。 ## 糟糕至極的初步表現
據悉,Gemini 3.6 Flash在Vertex AI上線後,早期實測結果令人大跌眼鏡。該模型在前端界面生成與空間推理方面的表現極其糟糕,幾乎全面崩盤。在前端代碼競技場中,Gemini 3.6 Flash不僅不敵Claude Fable 5、GPT-5.6 Sol等當紅模型,甚至連Meta的Muse Spark 1.1都未能超越,這一結果令許多開發者感到難以置信。 有開發者使用2-shot測試該模型界面生成能力,結果發現輸出的界面代碼邏輯錯亂,組件嵌套混亂,交互邏輯斷裂,完全無法投入實際使用。「這是我真正見過的最差結果。」一位開發者在社交平台上如此評價,並附上截圖迅速在開發者社區中引發廣泛共鳴。 ## 空間推理能力明顯退步
更令人擔憂的是Gemini 3.6 Flash在空間推理方面的表現。有開發者專門錄製了視頻,逐幀測試該模型在空間關係理解上的表現。結果顯示,模型頻繁出錯,對基礎位置關係和方向判斷的準確率相比上一代3.5 Flash出現明顯退步。即便測試者嘗試開啟「high thinking」高性能模式,結果仍然不盡人意。 另一名網友在使用了高推理強度後表示第一印象不佳:「木紋紋理看起來還行,沒什麼特別之處,大理石近距離看反射效果還不錯,但存在bug。」第二印象甚至更差,在CursorBench上,Gemini 3.6 Flash還不如Cursor的Composer 2.5。 ## 基準測試成績慘淡
即便是谷歌自行發佈的測試結果,也顯示Gemini 3.6 Flash在代碼任務上已被其他模型超越,僅在視覺和上下文基準測試中勉強保持領先。而在第三方綜合測評平台Artificial Analysis上,Gemini 3.6 Flash的得分與3.5 Flash完全相同,整體表現不如Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra等多個競爭對手。 更有網友發現該模型的知識截止日期實際上並未更新到其所聲稱的時間,直指這是一個「未完成的模型」。該模型聲稱知識截止於2026年3月,但測試發現它對2026年甚至2025年的大部分內容一無所知,實際知識似乎停留在2025年1月。 ## 快而無用的Flash-Lite
除了Gemini 3.6 Flash,谷歌還同步發佈了Gemini 3.5 Flash-Lite,主打速度快,每秒可輸出350個token。然而,速度的提升並未帶來用戶的認可,反而引發了更強烈的質疑。「快速給出一個錯誤答案,等於用更高的效率浪費用戶的時間。」有用戶如此批評。更何況,與競爭對手相比,這款模型價格更貴,效果更差,性價比極為低下。 此外,谷歌還發布了網絡安全模型Gemini 3.5 Flash Cyber,但同樣未能在行業內引起正面反響。 ## Gemini 3.5 Pro再度延期
在發佈公告中,谷歌終於承認Gemini 3.5 Pro還沒有完全準備好。與此同時,谷歌透露Gemini 4已開始「目前最雄心勃勃的預訓練」,並對取得的進展感到非常振奮。據CNBC報道,這是谷歌「有史以來規模最大的預訓練項目」。 行業分析人士推測,從目前情況來看,近期3.5 Pro的開發進展並不理想,因此谷歌不得不啟動全新的預訓練課程。這意味著用戶期待已久的下一代旗艦模型,短期內仍無法面世。 ## 業界質疑谷歌戰略失誤
這場發佈會引發的爭議遠不止於模型本身。有用戶諷刺稱,在算力緊缺的時代,DeepMind這種浪費算力發佈邏輯混亂的模型的行為,等同於瀆職,還不如直接將資源轉讓給Moonshot等競爭對手。 這番言論背後,折射出開發者社群對谷歌「版本號遊戲」的深層厭惡。有評論指出,谷歌似乎陷入了某種「官僚主義的指標狂熱」——為了在財報和發佈會上展示更高的版本號和更快的推理速度,犧牲了AI最本質的真實效用。「谷歌這種趕鴨子上架、敗壞口碑的做法到底圖什麼?」成為業界普遍質疑的問題。 ## 谷歌在AGI競賽中的處境堪憂
此次事件引發了一個更深層次的問題:在AGI競賽中,谷歌還能保有一席之地嗎?從原本被視為AI領域的領頭羊,到如今被競爭對手逐一超越,再到發布被稱為「史上最差」的模型,谷歌的AI戰略正面臨嚴峻考驗。 與此同時,其他科技巨頭如OpenAI、Anthropic、Meta以及眾多初創公司正在快速推進各自的大模型研發,紛紛推出更強大的產品。在這種情況下,谷歌如果不能盡快解決模型質量問題,重新贏得開發者信任,其在AI領域的領先地位恐怕將難以維繫。
Related
相關文章

AI醫療捲了10年終於悟了:不用替代醫生,而是給醫院裝上超強buff
這篇消息聚焦「AI醫療捲了10年終於悟了:不用替代醫生,而是給醫院裝上超強buff」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

一次測試,逼 OpenAI 最高模型,黑進了全球最大 AI 開源平臺
這篇消息聚焦「一次測試,逼 OpenAI 最高模型,黑進了全球最大 AI 開源平臺」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

Kimi K3其實“賤賣”了
Kimi K3其實“賤賣”了超聚焦2026.07.22 10:50 · 來自湖北全文4824字00:00 / 13:57別拿DeepSeek攬Kimi的活。文 | 超聚焦Kimi K3,可能是月之暗面成立以來最接近“封神”的一次。在7月17日公佈的Artificial Analysis獨立測試中,K3以57分登上綜合智能指數全球第三,超過Claude Opus 4.

Mac 版 Claude Code 集成 iOS 模擬器,可 AI 構建和測試 App
Anthropic 旗下官方帳號 @ClaudeDevs 於今日(7 月 22 日)在 X 平台發文宣布,Mac 桌面版 Claude Code 已正式內建整合 iOS 模擬器,開發者現在可以直接在模擬器中建構、執行與測試 iOS 應用程式,且過程中完全不需要額外授予螢幕錄製或輔助功能權限。這項功能目前以公測版本形式開放,官方已邀請開發者搶先體驗。

大模型正在“變小”?
# 大模型正在“变小”:从云端下凡到终端的智能革命 在刚刚过去的WAIC 2026上,一个明显的风向转变正在发生:厂商不再像去年那样热衷于比拼模型参数规模和榜单跑分,反而集体谈论“模型能干什么”“能不能赚钱”。细心观察不难发现,几乎所有的参展商都在推广轻量化部署,纷纷拿出自家的“mini版”大模型。曾几何时,我们习惯了让手机语音助手在电梯里失灵、让汽车导航在隧道里沉默、让相册里的AI修图因断网变成灰色图标——真正的智能似乎永远依赖那朵“云”。

七月起,大模型進入「無限戰爭」
# 七月起,大模型进入“无限战争” 2026年7月,全球大模型产业迎来一道分水岭。市场猛然意识到,在这个行业里,没有任何一个模型性能的领先地位是安全的——胜利的保质期正以月甚至周为单位缩短。 短短几周内,中国五家头部独立大模型公司各自展开了截然不同却同样急迫的行动。智谱以4.2%的新增股份换取314亿港元融资,并宣布两年内不追求短期变现;MiniMax在同一周推出160亿港元的配股加可转债组合,创始人宣布零薪酬直至实现AGI;月之暗面发布了参数规模达2.