Gemini 3.6 Flash來了,但網友笑得更大聲:省下了token,卻沒保住智商
重點摘要
AI資訊AI新閒資訊正文Gemini 3.6 Flash來了,但網友笑得更大聲:省下了token,卻沒保住智商發布於AI新閒資訊時間 :Jul 22, 2026閱讀 :1分鐘如果你從去年就開始用Gemini,最近最流行的一句調侃是:那種感覺就像看著自家兄弟慢慢得了阿爾茨海默症。按理說,一家公司發新模型,本該是用來打臉這種調侃的。
# Gemini 3.6 Flash來了,但網友笑得更大聲:省下了token,卻沒保住智商
科技巨頭Google週二晚間一口氣發佈三款新模型,試圖在AI賽道重新搶回聲量。然而,這場備受期待的發表會並未如預期迎來好評,反而在社群平台上掀起新一波嘲諷浪潮。網友們調侃:「那種感覺就像看著自家兄弟慢慢得了阿爾茨海默症。」原本新模型問世該是打破這種刻板印象的最佳機會,但Google這次的表現,卻讓許多人直呼「他們都不看好你,偏偏你最不爭氣」。 本次發佈的三款模型分別是3.6 Flash、3.5 Flash-Lite,以及專攻資安的3.5 Flash Cyber。官方部落格延續一貫的口吻,強調「更高效、更聰明、為大規模AI agent而生」,然而實際體驗卻呈現冰火兩重天的局面。 ## 當家頭牌3.6 Flash:省錢但不省心
被定位為「真正扛活的幹活模型」,3.6 Flash是今年5月I/O大會上3.5 Flash的小版本迭代。它最大的賣點在於省token。根據Artificial Analysis Index的數據,3.6 Flash比3.5 Flash少用了17%的輸出token,在DeepSWE這類場景甚至能省到65%,多步任務的推理步數和工具調用也明顯減少。 價格方面確實有所讓步,輸入1.5美元每百萬token,輸出7.5美元每百萬token,相較於上一代的9美元輸出價,確實降了一截。官方強調「又快又省」,單個agent任務的成本被成功壓低。 在基準測試上,代碼能力成為重點突破領域。DeepSWE從37%提升到49%,官方聲稱多餘代碼改動更少、執行循環更短,生成代碼更貼近生產環境;機器學習研究方向的MLE Bench從49.7%躍升至63.9%;計算機操作OSWorld-Verified從78.4%升至83%。此外,文件解析、圖表數據分析、報告起草等多模態任務也有明顯進步。一個不起眼但實用的更新是,知識截止日期終於從2025年1月推進到2026年3月。 安全方面,3.6 Flash搭載升級版Frontier Safety防護,重點鎖定化學、生物、放射性、核與網絡攻擊等濫用風險,抗越獄能力更強,同時力求不誤傷正常需求。 ## Flash-Lite逆襲上位,3Flash淪為舊世代
比3.6 Flash低一檔的3.5 Flash-Lite,以「快」和「便宜」打出一片天。每秒可吐350個token,價格更是殺到輸入0.3美元、輸出2.5美元每百萬token,品質較3月發佈的3.1 Flash-Lite大幅提升。 真正令人驚豔的是,這個「低檔小弟」在不少agent和代碼任務上竟反超輩分更高的3Flash。SWE-Bench Pro成績為54.2%對49.6%,OSWorld-Verified為74.0%對65.1%,意味著過去需要由3Flash執行的任務,現在有了更快更強的平替方案。Terminal-Bench 2.1從31%飆升至54%,長上下文GDM-MRCR v2從60.1%提升至72.2%,真實任務執行GDPval-AA v2更從642猛增至1140。 ## 資安特化模型:雙面刃的尷尬
3.5 Flash Cyber是本次發布中畫風最不同的產品,專門用來搜尋和修補程式碼中的安全漏洞。Google的邏輯是:現在AI找漏洞的速度比現有系統修補速度還快,漏洞越積越多,不如用便宜高效的Flash來批量處理。 該模型在3.5 Flash基礎上微調,搭配自家CodeMender工具,由多個Flash Cyber agent協同工作,最終彙總成報告。在業界知名的CyberGym基準測試中達到第一梯隊水平,且比更大的模型更省token。然而,由於找漏洞技術是把雙刃劍,Google採取極度保守策略,現階段僅對可信合作伙伴限量開放內測,以防遭惡意利用。 ## 旗艦跳票:3.5 Pro的難產之痛
發表會看似熱鬧,但真正令外界關注的旗艦模型3.5 Pro卻遲遲未見蹤影。官方僅以「正在和合作夥伴測試,準備好就上」帶過,但背後故事可能沒那麼體面。 據彭博社等媒體報導,3.5 Pro的代碼生成能力始終未達內部預期。Google在6月下旬緊急更新訓練數據試圖補救,成績卻仍未見起色。更有傳聞指出,Google已推翻原有訓練方案,從零開始重新訓練。Google AI宣傳委員Logan Kilpatrick甚至索性跳過3.5 Pro,將預告重點直接轉向Gemini 4,聲稱「已啟動史上最雄心勃勃的Gemini 4預訓練,進展令人興奮」。放在旗艦跳票的背景下解讀,此舉不無轉移視線、畫餅續命的嫌疑。 ## 網友不買單:智能原地踏步,性價比不如對手
第三方評測機構Artificial Analysis的數據顯示,兩個新模型確實將單任務耗時砍半、token效率提升,Flash-Lite的智能指數也漲了11分,但3.6 Flash的智能水平相比3.5 Flash幾乎原地踏步。 X平台上網友直言:「3.6 Flash在Artificial Analysis上跟3.5 Flash拿了一模一樣的分,還不如Meta Spark1.1、GLM-5.2、5.6 Luna、Sonnet5、Grok4.5、5.6 Terra這一票對手,簡直爛透了。」
更尷尬的是性價比問題。網友Angel指出,3.6 Flash的使用成本比GPT-5.6 Sol medium還高,智能程度卻更低,形成「又貴又笨」的尷尬組合。Flash系列立身根本就是性價比,如今卻被當場點破不如對手,無異於自砸招牌。作為對比,OpenAI的Tibo同時宣布,Codex和ChatGPT Work付費用戶因週活躍用戶達1000萬,迎來新一輪額度重置——此對比更凸顯Google的尷尬處境。 ## 實測翻車不斷:基礎解碼出包,中文選詞離譜
網友Balder的實測回饋更為直接,稱三個模型性能全比之前的3.5 Flash差,問題包括基礎解碼就有毛病、中文選詞經常離譜,生成的圖片影片品質極差、跟指令對不上且限額嚴重,頻繁出現記憶混亂、調用完全錯誤的工具。他甚至拋出陰謀論,認為Google之所以如此,是為了把算力騰出來賣給Anthropic,嘲諷道:「這就是皮查伊想要的Cloud First。」
X網友Conor Dart使用Google自家的Antigravity測試AI生成遊戲,結果木頭紋理更差了,大理石看起來差不多但依舊無法使用。他直言「又是一次翻車」,表示自己「還是等Gemini 3.5或者3.6 Pro吧」。 ## 結語:科技樹是否點歪? 一邊是官方口中「更高效、更便宜、更省token」的漂亮帳本,一邊是多數網友的當場差評,以及旗艦跳票、大牛出走、市值縮水等一連串糟心事。這不禁令人好奇,Google這次是否真的點歪了科技樹——光顧著省成本,卻忘了提升智商,只能先靠幾個Flash模型穩住場面。 Gemini 4的預訓練已經啟動,這一把若再翻車,那句「阿爾茨海默症」的玩笑,恐怕真要成為現實。在AI賽道日益競爭激烈的今天,Google需要的或許不只是省token,而是重新找回曾經的創新靈魂。
Related
相關文章

天立啟鳴發佈教育AGI白皮書:破解教育“不可能三角”
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 天立啟鳴發佈教育AGI白皮書:破解教育“不可能三角” 量子位的朋友們 2026-07-22 11:54:49 來源:量子位 從答題響應到心智仿真 當下教育數字化已走完信息化、數字化兩大階段,但教育仍深陷質量、成本、規模難以兼顧的“不可能三角”:傳統自適應工具、通用大模型僅停留在內容分發表層,只能完成答題響應、習題推薦,無法仿真學習者內在認知邏輯,難以破解統一教學與異質認知的核心矛盾,行業亟待從“信息傳遞”邁向“認知仿真”。 7月18日,在2026第9屆世界人工智能大會(WAIC)未來計算與未來算力論壇上,天立國際、啟鳴達人、天立啟鳴AI研究院、AIII人工智能國際研究院,以及北京航空航天大學國際創新研究院聯合打造併發布了《世界模型驅動的教育AGI白皮書——從認知仿真到教育智能體的範式躍遷》(以下簡稱:《白皮書》)。 天立國際首席科學家、啟鳴達人公司CTO、天立啟鳴AI研究院院長、北京航空航天大學國際創新研究院基礎教育通用人工智能實驗室首席科學家兼聯合主任劉志毅在論壇上對《白皮書》做了詳細解讀。 《白皮書》以認知世界模型(CWM)為底座、以LAM(Learning Assessment-Modeling)閉環為範式,提出教育仿真器—規劃器—渲染器為三位一體的工程架構。並將”湧現式教育”(Emergent Education)確立為未來願景、”認知共生”(Cognitive Symbiosis)確立為人機關係主張,為政策制定者、教育從業者、技術開發者與學術研究者提供下一代智能教育基礎設施的理論錨點與落地指南。 值得一提的是,白皮書的技術主張並非停留在紙

大廠AI入口大戰升級,誰是最能幹活的桌面Agent?
大廠AI入口大戰升級,誰是最能幹活的桌面Agent?劃重點KeyPoints2026.07.22 11:57 · 來自浙江全文4694字00:00 / 13:42實測騰訊WorkBuddy、字節豆包專業版、百度搭子、阿里QoderWork文 | 劃重點KeyPoints,作者|心怡,編輯|重點君互聯網大廠間的AI入口大戰打到了桌面端。先說一條剛出爐的消息。據《財經》7月21日報道,阿里即將推出千問辦公,把QoderWork、悟空、MuleRun三款Agent產品合併成,交給釘釘新任CEO陳宇森負責。不止阿里,騰訊也正把資源集中到WorkBuddy上,字節內部討論把飛書和豆包辦公深度整合。信號很明確,持續半年的大廠Agent“賽馬”結束,C端的入口大戰剛歇,各家開始把資源集中到新戰場:桌面Agent的入口大戰升級了。目前戰況如何?數據顯示,WorkBuddy今年7月DAU已突破1300萬,是國內用戶活躍度最高的Agent辦公產品。再看一組訪問量數據,從六月桌面AI原生辦公智能體的訪問量看,騰訊WorkBuddy、阿里QoderWork排在第一梯隊。四位選手各有來頭。WorkBuddy產品底座沿用打磨兩年多的CodeBuddy內核,馬化騰在財報會上直接稱它是“中國使用最廣的效率智能體服務”。豆包專業版背靠字節自家的Seedream、Seedance,是四家裡多模態彈藥比較足的一個,但只跑自家模型、生態也有些封閉。百度搭子入局較晚但動作密集、持續升級,7月剛甩出個人版升級、企業版和“搭子聯盟”三個更新。QoderWork是阿里把Agent能力從代碼搬到辦公的產物,招牌是帶下載量排行的技能市場和15套專家套件,即將要升格為“千問辦公”的底座。一線城市機場和地鐵的廣告位上,大家都說自己是六邊形戰士。但用戶更多隻關心一件事:今天要選一款Agent,到底誰能真正幹活?這次,我們挑兩個高頻

二級市場投資人WAIC上談AI下一輪機會:國產算力鏈、模型公司商業化和估值空間
這篇消息聚焦「二級市場投資人WAIC上談AI下一輪機會:國產算力鏈、模型公司商業化和估值空間」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

Kimi K3其實“賤賣”了
Kimi K3其實“賤賣”了超聚焦2026.07.22 10:50 · 來自湖北全文4824字00:00 / 13:57別拿DeepSeek攬Kimi的活。文 | 超聚焦Kimi K3,可能是月之暗面成立以來最接近“封神”的一次。在7月17日公佈的Artificial Analysis獨立測試中,K3以57分登上綜合智能指數全球第三,超過Claude Opus 4.

Mac 版 Claude Code 集成 iOS 模擬器,可 AI 構建和測試 App
Anthropic 旗下官方帳號 @ClaudeDevs 於今日(7 月 22 日)在 X 平台發文宣布,Mac 桌面版 Claude Code 已正式內建整合 iOS 模擬器,開發者現在可以直接在模擬器中建構、執行與測試 iOS 應用程式,且過程中完全不需要額外授予螢幕錄製或輔助功能權限。這項功能目前以公測版本形式開放,官方已邀請開發者搶先體驗。
