何夕2077生成式AI

谷歌發佈三款大模型

2026年7月22日 00:00

重點摘要

谷歌今日正式发布三款全新大语言模型,包括 Gemini 3.6 Flash、3.5 Flash-Lite 以及专为网络安全场景打造的 3.5 Flash Cyber。此次更新聚焦于提升 Agent(智能体)规模化部署所需的 Token 效率、降低延迟,并进一步优化性价比。谷歌 Gemini 团队产品管理高级总监 Tulsee Doshi 在官方博客中表示,新模型旨在帮助开发者和客户在构建生产级 AI 智能体时,找到效率与质量的最佳平衡点。 作为此次发布的核心,Gemini 3.6 Flash 被定位为“主力模型”。

站內 AI 整理稿

谷歌今日正式发布三款全新大语言模型,包括 Gemini 3.6 Flash、3.5 Flash-Lite 以及专为网络安全场景打造的 3.5 Flash Cyber。此次更新聚焦于提升 Agent(智能体)规模化部署所需的 Token 效率、降低延迟,并进一步优化性价比。谷歌 Gemini 团队产品管理高级总监 Tulsee Doshi 在官方博客中表示,新模型旨在帮助开发者和客户在构建生产级 AI 智能体时,找到效率与质量的最佳平衡点。作为此次发布的核心,Gemini 3.6 Flash 被定位为“主力模型”。相较于上一代 3.

5 Flash,它在编程、知识工作和多模态处理能力上均有显著提升。根据 Artificial Analysis 指数,3.6 Flash 在输出 Token 消耗上降低了 17%,而在 Datacurve 的 DeepSWE 等特定基准测试中,某些任务甚至实现了高达 65% 的效率优化。在定价方面,3.6 Flash 也更具竞争力,输入价格为每百万 Token 1.50 美元,输出价格为每百万 Token 7.50 美元,这使得执行复杂 Agent 任务的总体成本大幅下降。性能数据方面,3.6 Flash 表现亮眼。在 DeepSWE 基准测试中,其精确度达到 49%,远超前代 3.

5 Flash 的 37%,意味着它能有效减少不必要的代码编辑和执行循环。在机器学习研究基准 MLE Bench 上,3.6 Flash 得分从 49.7% 跃升至 63.9%。同时,其内置的“计算机使用”能力也得到了增强,在 OSWorld-Verified 测试中得分从 78.4% 提升至 83.0%。谷歌还强调,3.6 Flash 在文档解析、图表分析和报告起草等知识工作任务中表现出色,已获得 Hebbia 和 Harvey 等客户的积极反馈。针对需要高吞吐量和低延迟的应用场景,谷歌推出了 Gemini 3.5 Flash-Lite。这是目前 3.

5 系列中速度最快的模型,根据 Artificial Analysis 测量,其输出速度可达每秒 350 个 Token。该模型定价极具竞争力,输入价格仅为每百万 Token 0.30 美元,输出价格为每百万 Token 2.50 美元。尽管是轻量级模型,但它在编程和 Agent 任务上的表现超越了前代 3.1 Flash-Lite,甚至在多项基准测试中优于 3 Flash 标准版。具体来看,3.5 Flash-Lite 在 Terminal-Bench 2.1 的 Agent 任务中得分 54%,远超 3.

1 Flash-Lite 的 31%;在长上下文任务 GDM-MRCR v2 中得分 72.2%,对比之前的 60.1% 提升显著。在现实世界任务执行方面,其 GDPval-AA v2 得分也高达 1140,相比之下 3.1 Flash-Lite 仅为 642。谷歌表示,3.5 Flash-Lite 同样内置了“计算机使用”工具,支持开发者针对不同工作负载配置思考层级,在极致速度和复杂子任务处理间灵活切换。在网络安全领域,谷歌推出了专门的 Gemini 3.5 Flash Cyber 模型,并配合 CodeMender 代码安全智能体一同发布。该模型基于 3.

5 Flash 进行微调,专门用于发现、验证和修补代码安全漏洞。在热门基准测试 CyberGym 上,3.5 Flash Cyber 展现出极具竞争力的表现。考虑到该技术的双重用途性质,谷歌采取了审慎的部署策略。3.5 Flash Cyber 将通过 CodeMender 平台,在有限准入试点计划中专门提供给政府和受信任的合作伙伴。除了三款新模型外,谷歌还透露了未来的路线图。Gemini 3.5 Pro 目前正在与合作伙伴进行测试,并计划在准备就绪后广泛推出。同时,谷歌团队已经启动了其迄今为止最雄心勃勃的预训练计划,下一代架构 Gemini 4 的开发正在积极推进中。

对于此次发布的模型,安全性也是重点考量。Gemini 3.6 Flash 配备了增强的 Frontier Safety 防护措施,在化学、生物、放射性和核(CBRN)以及网络攻击滥用领域大幅提升了抗越狱能力,同时针对有益用途减少了拒绝率。在可用性方面,Gemini 3.6 Flash 和 3.5 Flash-Lite 即日起已面向开发者通过 Google AI Studio 和 Android Studio 中的 Gemini API 开放,并已集成至 Google Antigravity。企业用户可通过 Gemini Enterprise Agent Platform 使用。此外,3.

6 Flash 也已上线 Gemini Enterprise 应用和面向普通用户的 Gemini 应用。谷歌表示,3.5 Flash-Lite 也正在逐步整合到 Google 搜索中。业界分析认为,此次模型发布标志着谷歌在 AI 智能体基础设施层面的一次重要迭代。通过对效率、成本和专业能力的多维度优化,谷歌正在为开发者提供从高精度主力模型到极致性价比轻量模型,再到垂直领域专业模型的完整工具链,以推动 AI 智能体从实验走向大规模商业应用。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前