Gemini 3.6 Flash來了,但網友笑得更大聲:省下了token,卻沒保住智商
重點摘要
AI資訊AI新閒資訊正文Gemini 3.6 Flash來了,但網友笑得更大聲:省下了token,卻沒保住智商發布於AI新閒資訊時間 :Jul 22, 2026閱讀 :1分鐘如果你從去年就開始用Gemini,最近最流行的一句調侃是:那種感覺就像看著自家兄弟慢慢得了阿爾茨海默症。按理說,一家公司發新模型,本該是用來打臉這種調侃的。
# Gemini 3.6 Flash來了,但網友笑得更大聲:省下了token,卻沒保住智商
科技巨頭Google週二晚間一口氣發佈三款新模型,試圖在AI賽道重新搶回聲量。然而,這場備受期待的發表會並未如預期迎來好評,反而在社群平台上掀起新一波嘲諷浪潮。網友們調侃:「那種感覺就像看著自家兄弟慢慢得了阿爾茨海默症。」原本新模型問世該是打破這種刻板印象的最佳機會,但Google這次的表現,卻讓許多人直呼「他們都不看好你,偏偏你最不爭氣」。 本次發佈的三款模型分別是3.6 Flash、3.5 Flash-Lite,以及專攻資安的3.5 Flash Cyber。官方部落格延續一貫的口吻,強調「更高效、更聰明、為大規模AI agent而生」,然而實際體驗卻呈現冰火兩重天的局面。 ## 當家頭牌3.6 Flash:省錢但不省心
被定位為「真正扛活的幹活模型」,3.6 Flash是今年5月I/O大會上3.5 Flash的小版本迭代。它最大的賣點在於省token。根據Artificial Analysis Index的數據,3.6 Flash比3.5 Flash少用了17%的輸出token,在DeepSWE這類場景甚至能省到65%,多步任務的推理步數和工具調用也明顯減少。價格方面確實有所讓步,輸入1.5美元每百萬token,輸出7.5美元每百萬token,相較於上一代的9美元輸出價,確實降了一截。官方強調「又快又省」,單個agent任務的成本被成功壓低。在基準測試上,代碼能力成為重點突破領域。
DeepSWE從37%提升到49%,官方聲稱多餘代碼改動更少、執行循環更短,生成代碼更貼近生產環境;機器學習研究方向的MLE Bench從49.7%躍升至63.9%;計算機操作OSWorld-Verified從78.4%升至83%。此外,文件解析、圖表數據分析、報告起草等多模態任務也有明顯進步。一個不起眼但實用的更新是,知識截止日期終於從2025年1月推進到2026年3月。安全方面,3.6 Flash搭載升級版Frontier Safety防護,重點鎖定化學、生物、放射性、核與網絡攻擊等濫用風險,抗越獄能力更強,同時力求不誤傷正常需求。## Flash-Lite逆襲上位,3Flash淪為舊世代
比3.6 Flash低一檔的3.5 Flash-Lite,以「快」和「便宜」打出一片天。每秒可吐350個token,價格更是殺到輸入0.3美元、輸出2.5美元每百萬token,品質較3月發佈的3.1 Flash-Lite大幅提升。 真正令人驚豔的是,這個「低檔小弟」在不少agent和代碼任務上竟反超輩分更高的3Flash。SWE-Bench Pro成績為54.2%對49.6%,OSWorld-Verified為74.0%對65.1%,意味著過去需要由3Flash執行的任務,現在有了更快更強的平替方案。Terminal-Bench 2.1從31%飆升至54%,長上下文GDM-MRCR v2從60.1%提升至72.2%,真實任務執行GDPval-AA v2更從642猛增至1140。 ## 資安特化模型:雙面刃的尷尬
3.5 Flash Cyber是本次發布中畫風最不同的產品,專門用來搜尋和修補程式碼中的安全漏洞。Google的邏輯是:現在AI找漏洞的速度比現有系統修補速度還快,漏洞越積越多,不如用便宜高效的Flash來批量處理。 該模型在3.5 Flash基礎上微調,搭配自家CodeMender工具,由多個Flash Cyber agent協同工作,最終彙總成報告。在業界知名的CyberGym基準測試中達到第一梯隊水平,且比更大的模型更省token。然而,由於找漏洞技術是把雙刃劍,Google採取極度保守策略,現階段僅對可信合作伙伴限量開放內測,以防遭惡意利用。 ## 旗艦跳票:3.5 Pro的難產之痛
發表會看似熱鬧,但真正令外界關注的旗艦模型3.5 Pro卻遲遲未見蹤影。官方僅以「正在和合作夥伴測試,準備好就上」帶過,但背後故事可能沒那麼體面。 據彭博社等媒體報導,3.5 Pro的代碼生成能力始終未達內部預期。Google在6月下旬緊急更新訓練數據試圖補救,成績卻仍未見起色。更有傳聞指出,Google已推翻原有訓練方案,從零開始重新訓練。Google AI宣傳委員Logan Kilpatrick甚至索性跳過3.5 Pro,將預告重點直接轉向Gemini 4,聲稱「已啟動史上最雄心勃勃的Gemini 4預訓練,進展令人興奮」。放在旗艦跳票的背景下解讀,此舉不無轉移視線、畫餅續命的嫌疑。 ## 網友不買單:智能原地踏步,性價比不如對手
第三方評測機構Artificial Analysis的數據顯示,兩個新模型確實將單任務耗時砍半、token效率提升,Flash-Lite的智能指數也漲了11分,但3.6 Flash的智能水平相比3.5 Flash幾乎原地踏步。 X平台上網友直言:「3.6 Flash在Artificial Analysis上跟3.5 Flash拿了一模一樣的分,還不如Meta Spark1.1、GLM-5.2、5.6 Luna、Sonnet5、Grok4.5、5.6 Terra這一票對手,簡直爛透了。」
更尷尬的是性價比問題。網友Angel指出,3.6 Flash的使用成本比GPT-5.6 Sol medium還高,智能程度卻更低,形成「又貴又笨」的尷尬組合。Flash系列立身根本就是性價比,如今卻被當場點破不如對手,無異於自砸招牌。作為對比,OpenAI的Tibo同時宣布,Codex和ChatGPT Work付費用戶因週活躍用戶達1000萬,迎來新一輪額度重置——此對比更凸顯Google的尷尬處境。 ## 實測翻車不斷:基礎解碼出包,中文選詞離譜
網友Balder的實測回饋更為直接,稱三個模型性能全比之前的3.5 Flash差,問題包括基礎解碼就有毛病、中文選詞經常離譜,生成的圖片影片品質極差、跟指令對不上且限額嚴重,頻繁出現記憶混亂、調用完全錯誤的工具。他甚至拋出陰謀論,認為Google之所以如此,是為了把算力騰出來賣給Anthropic,嘲諷道:「這就是皮查伊想要的Cloud First。」
X網友Conor Dart使用Google自家的Antigravity測試AI生成遊戲,結果木頭紋理更差了,大理石看起來差不多但依舊無法使用。他直言「又是一次翻車」,表示自己「還是等Gemini 3.5或者3.6 Pro吧」。 ## 結語:科技樹是否點歪? 一邊是官方口中「更高效、更便宜、更省token」的漂亮帳本,一邊是多數網友的當場差評,以及旗艦跳票、大牛出走、市值縮水等一連串糟心事。這不禁令人好奇,Google這次是否真的點歪了科技樹——光顧著省成本,卻忘了提升智商,只能先靠幾個Flash模型穩住場面。 Gemini 4的預訓練已經啟動,這一把若再翻車,那句「阿爾茨海默症」的玩笑,恐怕真要成為現實。在AI賽道日益競爭激烈的今天,Google需要的或許不只是省token,而是重新找回曾經的創新靈魂。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。