谷歌連發三款“Lite、Flash”模型,但最強Pro再次缺席

重點摘要
谷歌連發三款“Lite、Flash”模型,但最強Pro再次缺席 在AI大模型競賽日益激烈的背景下,谷歌DeepMind團隊近日一口氣推出三款全新的Gemini系列模型,分別為Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及專注於網絡安全的Gemini 3.5 Flash Cyber。這些模型在效率、速度和專用性上各有突破,試圖滿足開發者對成本與性能的多樣化需求。然而,外界翹首以盼的旗艦級產品Gemini 3.
谷歌連發三款“Lite、Flash”模型,但最強Pro再次缺席
在AI大模型競賽日益激烈的背景下,谷歌DeepMind團隊近日一口氣推出三款全新的Gemini系列模型,分別為Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及專注於網絡安全的Gemini 3.5 Flash Cyber。這些模型在效率、速度和專用性上各有突破,試圖滿足開發者對成本與性能的多樣化需求。然而,外界翹首以盼的旗艦級產品Gemini 3.5 Pro依然沒有具體發佈時間,谷歌僅表示其正在與合作伙伴測試,同時首度透露下一代模型Gemini 4的預訓練已經啟動,引發業界對於其旗艦路線圖的更多猜測。此次發佈的核心亮點之一是Gemini 3.
6 Flash,它主打「告別囉嗦」的AI體驗。大語言模型在應用中,輸出token的數量直接影響費用與延遲,而這款模型透過更高效的推理來降低不必要的消耗。第三方機構的實測顯示,其輸出token使用量較前代平均減少了17%,在需要多步驟推理和工具調用的複雜任務中,節省幅度甚至高達65%。這意味著模型在完成任務時減少了冗餘的代碼編輯與循環操作,從而帶來直接的成本下降。Gemini 3.6 Flash的定價為每百萬輸入token 1.50美元、輸出token 7.50美元,相較於3.5 Flash的輸出價格有所降低,整體性價比更為突出。在性能方面,Gemini 3.
6 Flash在多個基準測試中展現了量化提升。例如,在DeepSWE基準得分從37%提升至49%,MLE-Bench機器學習工程測試從49.7%提升至63.9%,計算機使用能力在OSWorld-Verified測試中也由78.4%進步至83%。這些數據體現了它在編碼、多模態任務及智能體工作流中的優化。多家客戶如Figma、Harvey和JetBrains反饋,該模型在處理複雜知識型任務時,能夠在token效率、準確性和速度之間取得良好平衡。谷歌也展示了其在金融數據分析、代碼遷移以及創意工具等實際場景中的應用,強調其綜合實力的進化。如果說Gemini 3.
6 Flash追求效率與質量的平衡,那麼Gemini 3.5 Flash-Lite則將速度與成本卷到了新高度。這款被定義為3.5系列中「最快、最具成本效益」的模型,生成速度達到了每秒350個輸出token,約為上一代同類模型的兩倍。其定價極具攻擊性,每百萬輸入token僅需0.30美元,輸出token為2.50美元。如此低廉的價格和高吞吐量,使它在智能體搜索、大規模文檔處理等場景中極具吸引力。儘管名為「Lite」,它在SWE-Bench Pro測試中卻取得了54.2%的成績,超越了標準版Gemini 3 Flash的49.
6%;在OSWorld-Verified測試中也以74%的成績優於後者,顯示其「輕量不輕質」的特性。開發者使用Gemini 3.5 Flash-Lite時,還能根據工作負載靈活調整模型的「思考層級」,從簡單任務的低延遲模式到複雜任務的高質量輸出,都能自由切換。谷歌展示了其從海量電商數據中提取產品特徵、即時生成多個網頁設計概念、大規模收據翻譯以及快速構建遊戲等應用實例。早期客戶如Ashler和Ramp強調了該模型在速度、智能與成本之間的獨特組合,特別適合需要擴展智能體工作流和高併發數據處理的企業,這在一定程度上滿足了市場對經濟型高性能模型的需求。第三款模型Gemini 3.
5 Flash Cyber則是一款面向特定領域的專用模型,專注於網絡安全漏洞的檢測與修復。該模型基於Gemini 3.5 Flash進行微調,旨在以更低的token成本完成代碼安全任務。在CyberGym基準測試中,它的表現已達到前沿水平。考慮到網絡攻防的雙刃劍性質,谷歌採取了審慎的交付策略,不會全面開放,而是集成到其代碼安全智能體CodeMender中,作為有限訪問試點項目,僅獨家提供給政府和受信任的合作伙伴。谷歌透露,在內部測試中,這款模型在開源代碼庫V8 JavaScript Engine中發現了55個問題,其中10個漏洞是其他模型未能識別的,凸顯其專注安全領域的價值。
儘管Flash系列迭代迅速,但開發者社群最關心的旗艦模型Gemini 3.5 Pro依然缺席。谷歌上一次更新Pro系列是在今年2月發佈的Gemini 3.1 Pro,之後競爭對手如OpenAI和Anthropic陸續更新了各自的旗艦產品。今年5月,谷歌曾預告Pro版本已在內部使用,預期一個月內推出,但如今已至7月底仍未公開。有報道稱,谷歌因難以達到內部性能目標而面臨延遲。對此,谷歌DeepMind技術負責人回應說,Gemini 3.5 Pro正在與合作伙伴測試,計劃在準備就緒後廣泛提供,但未給出確切時間表。
同時,團隊首次正式提及下一代旗艦模型Gemini 4,稱其為「迄今為止最雄心勃勃的預訓練工作」,並已啟動相關進程。從三款新模型的佈局來看,谷歌當前的策略是在效率上建立優勢,壓低成本、提高速度,同時增強處理具體任務的能力。然而,伴隨著新模型的開放訪問,開發者社區也傳出不少負面聲音。有開發者反饋,Gemini 3.6 Flash在實際應用中表現不穩,例如反覆提示後仍忽略指令,輸出質量甚至不如幾個月前的舊模型。還有用戶指出,雖然定價便宜,但它在編碼基準上表現不如預期,相比資本規模更小的實驗室所打造的模型,成績顯得遜色。Artificial Analysis的評分顯示,3.
6 Flash的得分與前代持平,但排名落後於多個競品模型。這些反饋反映了市場對谷歌模型表現的更高期待。在AI大模型競爭進入白熱化階段的今天,單純依靠降本增效已不足以滿足專業用戶的需求,質量的穩定性與突破性同樣關鍵。谷歌在推廣Flash系列時強調其對企業投入產出比的思考,但如何平衡成本、速度與實際效果,仍是其需要應對的挑戰。目前,Gemini 3.5 Flash-Lite將逐步在谷歌搜索引擎中應用,而Gemini 3.5 Flash Cyber則通過邀請制落地,預計將在特定領域發揮作用。至於旗艦路線的下一步,則有待Gemini 3.5 Pro的正式問世以及Gemini 4的後續進展來揭曉。
總體而言,谷歌此次三款模型連發,展現了其在細分市場上的積極佈局,從極致性價比到專用安全領域都有所覆蓋。但開發者與用戶的目光仍聚焦於旗艦產品的性能突破。在未來的一段時間內,如何在快速迭代中重建市場對其頂級模型的信心,將是谷歌DeepMind需要直面的問題。隨著Gemini 4的預訓練啟動,業界也在等待這家科技巨頭能否在下一波AI浪潮中重新奪回技術高地。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。