剛剛,Gemini 3.6 Flash 正式發佈,但網友笑得更大聲了

2026年7月21日 07:27
剛剛,Gemini 3.6 Flash 正式發佈,但網友笑得更大聲了

重點摘要

Google 一口氣推出 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber 三個新模型,主打更省 token 與更低成本,但網友普遍認為性能進步有限,甚至被競爭對手超越。旗艦模型 3.5 Pro 因代碼能力未達標而跳票,官方轉而宣傳 Gemini 4 預訓練,被外界視為轉移焦點。

站內 AI 整理稿

Google 稍早一口氣推出三款新模型,包括 Gemini 3.6 Flash、3.5 Flash-Lite 以及專攻網路安全的 3.5 Flash Cyber,官方部落格照例以「更高效」、「更聰明」、「為大規模 AI agent 而生」等字眼包裝,然而網友的反應卻與官方預期截然相反。過去幾個月,用戶對 Gemini 系列模型的幽默批評層出不窮,最經典的一句莫過於「看著自家兄弟慢慢得了阿爾茨海默症」。本以為新模型能扭轉形象,但實際發布後,網路上嘲笑聲浪反而更高漲,形成一種「大家都不看好你,偏偏你最不爭氣」的尷尬局面。 先來看這次的主角 Gemini 3.6 Flash。官方將其定位為「主力」幹活模型,是今年 5 月 I/O 大會發表的 3.5 Flash 的小幅迭代版本。最大亮點在於省 token:根據 Artificial Analysis Index 的數據,3.6 Flash 相比 3.5 Flash 能減少 17% 的輸出 token,在 DeepSWE 這類基準測試上甚至可節省高達 65%。官方宣稱,執行多步任務時推理步數與工具調用次數都更少,意味著同樣的工作量,廢話更少、繞路更少,最終帳單更薄。價格方面也確實有感降價,輸入每百萬 token 1.5 美元,輸出每百萬 token 7.5 美元,而上一代 3.5 Flash 的輸出要價 9 美元,直接砍到七五折。又快又省,單一 agent 任務的成本因此明顯壓低。 基準測試數字則更為具體。代碼能力是重點項目:DeepSWE 從 37% 躍升至 49%,官方解釋是多餘代碼改動減少、執行循環縮短,生成的程式碼更貼近生產環境。機器學習研究方向的 MLE Bench 從 49.7% 拉到 63.9%。電腦操作能力方面,OSWorld-Verified 從 78.4% 升到 83%,並且「電腦操作」已成為 Gemini API 及企業版的內建工具,主打開箱即用。知識工作部分,GDPval-AA v2 從 1349 漲到 1421。客戶如 Hebbia、Harvey 回饋在多模態任務上表現突出,Figma 與 JetBrains 也出面背書。此外,一個不起眼但實用的更新是知識截止日期從 2025 年 1 月推進到 2026 年 3 月,總算翻過舊黃曆。安全方面,3.6 Flash 搭載升級版 Frontier Safety 防護,重點鎖定 CBRN(化學、生物、放射性、核)與網路攻擊兩類濫用,抗越獄能力更強,同時盡量不誤傷正常需求。 第二個模型是 3.5 Flash-Lite,定位比 3.6 Flash 更低一階,主打「快」與「便宜」,專治高吞吐、低延遲任務,例如 agent 搜尋、文件處理。根據 Artificial Analysis 測量,它是 3.5 系列中速度最快的,每秒可輸出 350 個 token,價格更是白菜價:輸入每百萬 token 0.3 美元、輸出 2.5 美元。官方說品質比今年 3 月發表的 3.1 Flash-Lite 好上一大截。一個靈活的設計是支援調整「推理檔位」,低負載時開最低檔以追求速度與省錢,碰上需要多步拆解的子任務則可調高思考檔位。電腦操作同樣內建為工具。跟前代相比,提升幅度相當驚人:Terminal-Bench 2.1 從 31% 衝到 54%,長上下文任務 GDM-MRCR v2 從 60.1% 提升到 72.2%,真實任務執行 GDPval-AA v2 更從 642 飆升至 1140。最有趣的是,這個「小弟」在不少 agent 與程式碼任務上居然反超了輩分更高的 3 Flash,例如 SWE-Bench Pro(54.2% 對 49.6%)、OSWorld-Verified(74.0% 對 65.1%),形成以小博大的局面,等於說跑 3 Flash 的活兒現在有了更快更強的平替。官方列舉使用場景:從海量電商數據中抽取產品特徵、幫 3.6 Flash 當副手一口氣生成 25 個網頁設計方案、批量翻譯總結收據、邊玩邊迭代做小遊戲。客戶如 Ashler、Palo Alto Networks、Ramp 也出面稱讚其「速度、智能、成本三合一」。 第三個模型 3.5 Flash Cyber 則畫風突變,專門用來查找與修補程式碼中的安全漏洞。Google 的邏輯是:現在 AI 找漏洞的速度已經比現有系統修漏洞的速度還快,漏洞越堆越多,不如用便宜高效的 Flash 來批量補鍋。該模型基於 3.5 Flash 微調,搭配自家 CodeMender 工具使用,CodeMender 內跑多個 Flash Cyber agent 協同工作,最後彙總成一份報告。在業界知名的 CyberGym 基準上,官方稱它摸到第一梯隊水準,且比更大的模型更省 token。但考量到「找漏洞」是雙面刃,Google 學 Anthropic 玩起安全敘事,將此模型鎖得死死的──只對「可信合作伙伴」限量開放,走內測,目的是讓一線防守方爭取時間,在漏洞被利用前先修掉,同時防止被拿來做壞事。 看到這裡,讀者可能想問:真正的旗艦模型 Gemini 3.5 Pro 去哪了?官方口徑是「正在和合作夥伴測試,準備好就上」。然而這套說辭背後的故事可能沒那麼體面。據彭博社等媒體報導,3.5 Pro 的程式碼生成能力一直未達內部預期,Google 6 月下旬還專門更新了一版訓練數據想補程式碼短板,結果成績依舊沒起色。更有傳聞指出,Google 乾脆推翻原本訓練方案,從零開始重新訓練。與此同時,Google AI 宣傳委員 Logan Kilpatrick 索性在輿論上跳過 3.5 Pro,將預告重點放在 Gemini 4,聲稱已啟動史上最雄心勃勃的預訓練,進展讓人興奮。但把這番話放在旗艦跳票的背景下看,多少有轉移焦點、畫餅續命的意味。 除了旗艦缺席的內幕,單看今天發布的 Flash 模型本身,網友也並不買單。第三方評測機構 Artificial Analysis 指出,兩個新模型確實將單任務耗時砍半、token 效率提升,Flash-Lite 的智能指數漲了 11 分,但 3.6 Flash 的智能水準相比 3.5 Flash 基本原地踏步。價格沒有便宜到足以忽略能力差距,能力也沒有高到能解釋成本。X 平台網友吐槽,3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿下一模一樣的分數,還不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 這一批對手,直呼「簡直爛透了」。另一位網友 Angel 從性價比切入,指出 Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 還高,智能程度卻更低,又貴又笨的組合對主打性價比的 Flash 系列來說等於自砸招牌。 對比之下,OpenAI 的 Tibo 剛剛發話,由於周活躍用戶達到 1000 萬,Codex 與 ChatGPT Work 的付費用戶迎來新一輪額度重置。這番正面消息讓 Google 的處境更顯尷尬。實測派網友 Balder 更直接開團,稱這三個模型性能全比之前的 3.5 Flash 還差,列舉了基礎解碼毛病、中文選詞離譜、生成圖片影片品質極差、記憶混亂、調用錯誤工具等問題,甚至陰謀論地認為 Google 是為了把算力騰出來賣給 Anthropic,諷刺這就是皮查伊想要的「Cloud First」。另一名網友 Conor Dart 用 Google 自家的 Antigravity 跑 AI 生成遊戲測試,結果木頭紋理更差,大理石看起來差不多但依舊不能用,直言又是一次翻車,表示自己還是等 Gemini 3.5/3.6 Pro 吧。 綜合來看,一邊是官方帳本上更高效、更便宜、更省 token 的漂亮數字,另一邊是多數網友的當場差評,以及旗艦跳票、大牛出走、市值縮水等一連串糟心事。這讓人不禁懷疑 Google 是否點歪了科技樹,光顧著省成本卻忘了提升智商,只能先靠幾個 Flash 模型穩住場面。反正 Gemini 4 的預訓練已經開跑,如果這一把再翻車,那句「阿爾茨海默症」的玩笑恐怕真要成為讖語了。

Related

相關文章

IT之家生成式AI

中國銀聯與 15 家商業銀行合作推“智能體銀行卡”,航旅縱橫、滴滴等一鍵智能支付

首頁 > 智能時代>人工智能 中國銀聯與 15 家商業銀行合作推“智能體銀行卡”,航旅縱橫、滴滴等一鍵智能支付 2026/7/22 9:16:37 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 7 月 22 日消息,中國銀聯 7 月 20 日宣佈推出智能體銀行卡解決方案,攜手商業銀行開啟銀行卡“智能體”時代。中國銀聯攜手 15 家商業銀行,相繼推出 AI 智能體銀行卡產品。

剛剛
量子位生成式AI

小紅書大模型IMO滿分奪金,第三題解法讓冠軍選手直呼優雅

小紅書大模型IMO滿分奪金,第三題解法讓冠軍選手直呼優雅 中國大模型首次獲得IMO官方金牌水平認證,而且一出手就是滿分。2026年國際數學奧林匹克競賽(IMO)成績正式公布,小紅書自研的大模型dots-note-3.0以六題全對的成績拿下42分滿分,順利奪金。這不僅是中國大模型在IMO官方評測中取得的最高成就,也是全球範圍內繼Google Gemini模型之後,第二個達到此水準的大模型。值得注意的是,Google當年僅答對五題,小紅書則是一分未失,成績更為亮眼。 小紅書大模型dots-note-3.

剛剛
IT之家生成式AI

小紅書大模型 IMO 滿分奪金,第三題解法讓冠軍選手直呼優雅

首頁 > 智能時代>人工智能 小紅書大模型 IMO 滿分奪金,第三題解法讓冠軍選手直呼優雅 量子位 2026/7/22 8:44:19 責編:故淵 評論: 感謝IT之家網友 ZERO_A_ONE 的線索投遞! 剛剛,IMO 2026 成績新鮮出爐,大模型交卷今年捲到了新高度。經 IMO 官方評定,小紅書大模型 dots-note-3.0,六道題全部答對,以滿分成績斬獲金牌。含金量有多高呢?

剛剛

谷歌Gemini 4開跑了,一夜三連發

這篇消息聚焦「谷歌Gemini 4開跑了,一夜三連發」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

剛剛

谷歌「史上最差」AI模型發佈,Gemini 3.5 Pro延期

# 谷歌「史上最差」AI模型發佈,Gemini 3.5 Pro延期引發業界震動 昨夜,谷歌DeepMind突如其來地發佈了三款AI模型,分別為Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。然而,這場原本被寄予厚望的發佈會,卻意外演變成一場公關災難。新模型一經推出便遭到開發者和用戶的強烈批評,被戲稱為谷歌「史上最差」的AI模型,同時備受期待的Gemini 3.5 Pro正式版再度延期,讓外界對谷歌在大模型競賽中的處境感到憂心。

剛剛