剛剛,Gemini 3.6 Flash 正式發佈,但網友笑得更大聲了

2026年7月21日 07:27
剛剛,Gemini 3.6 Flash 正式發佈,但網友笑得更大聲了

重點摘要

Google 一口氣推出 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber 三個新模型,主打更省 token 與更低成本,但網友普遍認為性能進步有限,甚至被競爭對手超越。旗艦模型 3.5 Pro 因代碼能力未達標而跳票,官方轉而宣傳 Gemini 4 預訓練,被外界視為轉移焦點。

站內 AI 整理稿

Google 稍早一口氣推出三款新模型,包括 Gemini 3.6 Flash、3.5 Flash-Lite 以及專攻網路安全的 3.5 Flash Cyber,官方部落格照例以「更高效」、「更聰明」、「為大規模 AI agent 而生」等字眼包裝,然而網友的反應卻與官方預期截然相反。過去幾個月,用戶對 Gemini 系列模型的幽默批評層出不窮,最經典的一句莫過於「看著自家兄弟慢慢得了阿爾茨海默症」。本以為新模型能扭轉形象,但實際發布後,網路上嘲笑聲浪反而更高漲,形成一種「大家都不看好你,偏偏你最不爭氣」的尷尬局面。先來看這次的主角 Gemini 3.6 Flash。

官方將其定位為「主力」幹活模型,是今年 5 月 I/O 大會發表的 3.5 Flash 的小幅迭代版本。最大亮點在於省 token:根據 Artificial Analysis Index 的數據,3.6 Flash 相比 3.5 Flash 能減少 17% 的輸出 token,在 DeepSWE 這類基準測試上甚至可節省高達 65%。官方宣稱,執行多步任務時推理步數與工具調用次數都更少,意味著同樣的工作量,廢話更少、繞路更少,最終帳單更薄。價格方面也確實有感降價,輸入每百萬 token 1.5 美元,輸出每百萬 token 7.5 美元,而上一代 3.

5 Flash 的輸出要價 9 美元,直接砍到七五折。又快又省,單一 agent 任務的成本因此明顯壓低。基準測試數字則更為具體。代碼能力是重點項目:DeepSWE 從 37% 躍升至 49%,官方解釋是多餘代碼改動減少、執行循環縮短,生成的程式碼更貼近生產環境。機器學習研究方向的 MLE Bench 從 49.7% 拉到 63.9%。電腦操作能力方面,OSWorld-Verified 從 78.4% 升到 83%,並且「電腦操作」已成為 Gemini API 及企業版的內建工具,主打開箱即用。知識工作部分,GDPval-AA v2 從 1349 漲到 1421。

客戶如 Hebbia、Harvey 回饋在多模態任務上表現突出,Figma 與 JetBrains 也出面背書。此外,一個不起眼但實用的更新是知識截止日期從 2025 年 1 月推進到 2026 年 3 月,總算翻過舊黃曆。安全方面,3.6 Flash 搭載升級版 Frontier Safety 防護,重點鎖定 CBRN(化學、生物、放射性、核)與網路攻擊兩類濫用,抗越獄能力更強,同時盡量不誤傷正常需求。第二個模型是 3.5 Flash-Lite,定位比 3.6 Flash 更低一階,主打「快」與「便宜」,專治高吞吐、低延遲任務,例如 agent 搜尋、文件處理。

根據 Artificial Analysis 測量,它是 3.5 系列中速度最快的,每秒可輸出 350 個 token,價格更是白菜價:輸入每百萬 token 0.3 美元、輸出 2.5 美元。官方說品質比今年 3 月發表的 3.1 Flash-Lite 好上一大截。一個靈活的設計是支援調整「推理檔位」,低負載時開最低檔以追求速度與省錢,碰上需要多步拆解的子任務則可調高思考檔位。電腦操作同樣內建為工具。跟前代相比,提升幅度相當驚人:Terminal-Bench 2.1 從 31% 衝到 54%,長上下文任務 GDM-MRCR v2 從 60.1% 提升到 72.

2%,真實任務執行 GDPval-AA v2 更從 642 飆升至 1140。最有趣的是,這個「小弟」在不少 agent 與程式碼任務上居然反超了輩分更高的 3 Flash,例如 SWE-Bench Pro(54.2% 對 49.6%)、OSWorld-Verified(74.0% 對 65.1%),形成以小博大的局面,等於說跑 3 Flash 的活兒現在有了更快更強的平替。官方列舉使用場景:從海量電商數據中抽取產品特徵、幫 3.6 Flash 當副手一口氣生成 25 個網頁設計方案、批量翻譯總結收據、邊玩邊迭代做小遊戲。

客戶如 Ashler、Palo Alto Networks、Ramp 也出面稱讚其「速度、智能、成本三合一」。第三個模型 3.5 Flash Cyber 則畫風突變,專門用來查找與修補程式碼中的安全漏洞。Google 的邏輯是:現在 AI 找漏洞的速度已經比現有系統修漏洞的速度還快,漏洞越堆越多,不如用便宜高效的 Flash 來批量補鍋。該模型基於 3.5 Flash 微調,搭配自家 CodeMender 工具使用,CodeMender 內跑多個 Flash Cyber agent 協同工作,最後彙總成一份報告。

在業界知名的 CyberGym 基準上,官方稱它摸到第一梯隊水準,且比更大的模型更省 token。但考量到「找漏洞」是雙面刃,Google 學 Anthropic 玩起安全敘事,將此模型鎖得死死的──只對「可信合作伙伴」限量開放,走內測,目的是讓一線防守方爭取時間,在漏洞被利用前先修掉,同時防止被拿來做壞事。看到這裡,讀者可能想問:真正的旗艦模型 Gemini 3.5 Pro 去哪了?官方口徑是「正在和合作夥伴測試,準備好就上」。然而這套說辭背後的故事可能沒那麼體面。據彭博社等媒體報導,3.

5 Pro 的程式碼生成能力一直未達內部預期,Google 6 月下旬還專門更新了一版訓練數據想補程式碼短板,結果成績依舊沒起色。更有傳聞指出,Google 乾脆推翻原本訓練方案,從零開始重新訓練。與此同時,Google AI 宣傳委員 Logan Kilpatrick 索性在輿論上跳過 3.5 Pro,將預告重點放在 Gemini 4,聲稱已啟動史上最雄心勃勃的預訓練,進展讓人興奮。但把這番話放在旗艦跳票的背景下看,多少有轉移焦點、畫餅續命的意味。除了旗艦缺席的內幕,單看今天發布的 Flash 模型本身,網友也並不買單。

第三方評測機構 Artificial Analysis 指出,兩個新模型確實將單任務耗時砍半、token 效率提升,Flash-Lite 的智能指數漲了 11 分,但 3.6 Flash 的智能水準相比 3.5 Flash 基本原地踏步。價格沒有便宜到足以忽略能力差距,能力也沒有高到能解釋成本。X 平台網友吐槽,3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿下一模一樣的分數,還不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 這一批對手,直呼「簡直爛透了」。

另一位網友 Angel 從性價比切入,指出 Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 還高,智能程度卻更低,又貴又笨的組合對主打性價比的 Flash 系列來說等於自砸招牌。對比之下,OpenAI 的 Tibo 剛剛發話,由於周活躍用戶達到 1000 萬,Codex 與 ChatGPT Work 的付費用戶迎來新一輪額度重置。這番正面消息讓 Google 的處境更顯尷尬。實測派網友 Balder 更直接開團,稱這三個模型性能全比之前的 3.

5 Flash 還差,列舉了基礎解碼毛病、中文選詞離譜、生成圖片影片品質極差、記憶混亂、調用錯誤工具等問題,甚至陰謀論地認為 Google 是為了把算力騰出來賣給 Anthropic,諷刺這就是皮查伊想要的「Cloud First」。另一名網友 Conor Dart 用 Google 自家的 Antigravity 跑 AI 生成遊戲測試,結果木頭紋理更差,大理石看起來差不多但依舊不能用,直言又是一次翻車,表示自己還是等 Gemini 3.5/3.6 Pro 吧。

綜合來看,一邊是官方帳本上更高效、更便宜、更省 token 的漂亮數字,另一邊是多數網友的當場差評,以及旗艦跳票、大牛出走、市值縮水等一連串糟心事。這讓人不禁懷疑 Google 是否點歪了科技樹,光顧著省成本卻忘了提升智商,只能先靠幾個 Flash 模型穩住場面。反正 Gemini 4 的預訓練已經開跑,如果這一把再翻車,那句「阿爾茨海默症」的玩笑恐怕真要成為讖語了。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

42 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前