何夕2077生成式AI

谷歌發佈三款大模型

2026年7月22日 00:00

重點摘要

谷歌今日正式发布三款全新大语言模型,包括 Gemini 3.6 Flash、3.5 Flash-Lite 以及专为网络安全场景打造的 3.5 Flash Cyber。此次更新聚焦于提升 Agent(智能体)规模化部署所需的 Token 效率、降低延迟,并进一步优化性价比。谷歌 Gemini 团队产品管理高级总监 Tulsee Doshi 在官方博客中表示,新模型旨在帮助开发者和客户在构建生产级 AI 智能体时,找到效率与质量的最佳平衡点。 作为此次发布的核心,Gemini 3.6 Flash 被定位为“主力模型”。

站內 AI 整理稿

谷歌今日正式发布三款全新大语言模型,包括 Gemini 3.6 Flash、3.5 Flash-Lite 以及专为网络安全场景打造的 3.5 Flash Cyber。此次更新聚焦于提升 Agent(智能体)规模化部署所需的 Token 效率、降低延迟,并进一步优化性价比。谷歌 Gemini 团队产品管理高级总监 Tulsee Doshi 在官方博客中表示,新模型旨在帮助开发者和客户在构建生产级 AI 智能体时,找到效率与质量的最佳平衡点。 作为此次发布的核心,Gemini 3.6 Flash 被定位为“主力模型”。相较于上一代 3.5 Flash,它在编程、知识工作和多模态处理能力上均有显著提升。根据 Artificial Analysis 指数,3.6 Flash 在输出 Token 消耗上降低了 17%,而在 Datacurve 的 DeepSWE 等特定基准测试中,某些任务甚至实现了高达 65% 的效率优化。在定价方面,3.6 Flash 也更具竞争力,输入价格为每百万 Token 1.50 美元,输出价格为每百万 Token 7.50 美元,这使得执行复杂 Agent 任务的总体成本大幅下降。 性能数据方面,3.6 Flash 表现亮眼。在 DeepSWE 基准测试中,其精确度达到 49%,远超前代 3.5 Flash 的 37%,意味着它能有效减少不必要的代码编辑和执行循环。在机器学习研究基准 MLE Bench 上,3.6 Flash 得分从 49.7% 跃升至 63.9%。同时,其内置的“计算机使用”能力也得到了增强,在 OSWorld-Verified 测试中得分从 78.4% 提升至 83.0%。谷歌还强调,3.6 Flash 在文档解析、图表分析和报告起草等知识工作任务中表现出色,已获得 Hebbia 和 Harvey 等客户的积极反馈。 针对需要高吞吐量和低延迟的应用场景,谷歌推出了 Gemini 3.5 Flash-Lite。这是目前 3.5 系列中速度最快的模型,根据 Artificial Analysis 测量,其输出速度可达每秒 350 个 Token。该模型定价极具竞争力,输入价格仅为每百万 Token 0.30 美元,输出价格为每百万 Token 2.50 美元。尽管是轻量级模型,但它在编程和 Agent 任务上的表现超越了前代 3.1 Flash-Lite,甚至在多项基准测试中优于 3 Flash 标准版。 具体来看,3.5 Flash-Lite 在 Terminal-Bench 2.1 的 Agent 任务中得分 54%,远超 3.1 Flash-Lite 的 31%;在长上下文任务 GDM-MRCR v2 中得分 72.2%,对比之前的 60.1% 提升显著。在现实世界任务执行方面,其 GDPval-AA v2 得分也高达 1140,相比之下 3.1 Flash-Lite 仅为 642。谷歌表示,3.5 Flash-Lite 同样内置了“计算机使用”工具,支持开发者针对不同工作负载配置思考层级,在极致速度和复杂子任务处理间灵活切换。 在网络安全领域,谷歌推出了专门的 Gemini 3.5 Flash Cyber 模型,并配合 CodeMender 代码安全智能体一同发布。该模型基于 3.5 Flash 进行微调,专门用于发现、验证和修补代码安全漏洞。在热门基准测试 CyberGym 上,3.5 Flash Cyber 展现出极具竞争力的表现。考虑到该技术的双重用途性质,谷歌采取了审慎的部署策略。3.5 Flash Cyber 将通过 CodeMender 平台,在有限准入试点计划中专门提供给政府和受信任的合作伙伴。 除了三款新模型外,谷歌还透露了未来的路线图。Gemini 3.5 Pro 目前正在与合作伙伴进行测试,并计划在准备就绪后广泛推出。同时,谷歌团队已经启动了其迄今为止最雄心勃勃的预训练计划,下一代架构 Gemini 4 的开发正在积极推进中。对于此次发布的模型,安全性也是重点考量。Gemini 3.6 Flash 配备了增强的 Frontier Safety 防护措施,在化学、生物、放射性和核(CBRN)以及网络攻击滥用领域大幅提升了抗越狱能力,同时针对有益用途减少了拒绝率。 在可用性方面,Gemini 3.6 Flash 和 3.5 Flash-Lite 即日起已面向开发者通过 Google AI Studio 和 Android Studio 中的 Gemini API 开放,并已集成至 Google Antigravity。企业用户可通过 Gemini Enterprise Agent Platform 使用。此外,3.6 Flash 也已上线 Gemini Enterprise 应用和面向普通用户的 Gemini 应用。谷歌表示,3.5 Flash-Lite 也正在逐步整合到 Google 搜索中。 业界分析认为,此次模型发布标志着谷歌在 AI 智能体基础设施层面的一次重要迭代。通过对效率、成本和专业能力的多维度优化,谷歌正在为开发者提供从高精度主力模型到极致性价比轻量模型,再到垂直领域专业模型的完整工具链,以推动 AI 智能体从实验走向大规模商业应用。

Related

相關文章

鈦媒體生成式AI

安謀科技公開新一代NPU架構 並牽頭髮起開源AI操作系統聯盟

安謀科技在2026世界人工智能大會上首次公開新一代NPU架構「周易」X3-Pro,並牽頭髮起開源AI操作系統聯盟AIOS,展現從IP授權公司轉向平台型生態的意圖。該公司提出三條技術路徑因應端側AI資源受限問題,並推出星辰300異構計算平台,同時聯合多家晶片與模型廠商成立AIOS聯盟,以擴大在終端產品端的影響力。

剛剛
量子位生成式AI

天立啟鳴發佈教育AGI白皮書:破解教育“不可能三角”

天立啟鳴於WAIC 2026發布《世界模型驅動的教育AGI白皮書》,提出以認知世界模型為核心的技術架構,試圖破解教育質量、成本、規模難以兼顧的「不可能三角」。該白皮書已落地107所學校、服務超過25萬師生,並在2026年高考中獲得86.22%的漲分率驗證。

剛剛
鈦媒體生成式AI

大廠AI入口大戰升級,誰是最能幹活的桌面Agent?

大廠AI入口大戰升級,誰是最能幹活的桌面Agent?劃重點KeyPoints2026.07.22 11:57 · 來自浙江全文4694字00:00 / 13:42實測騰訊WorkBuddy、字節豆包專業版、百度搭子、阿里QoderWork文 | 劃重點KeyPoints,作者|心怡,編輯|重點君互聯網大廠間的AI入口大戰打到了桌面端。先說一條剛出爐的消息。

剛剛
鈦媒體生成式AI

Kimi K3其實“賤賣”了

Kimi K3其實“賤賣”了超聚焦2026.07.22 10:50 · 來自湖北全文4824字00:00 / 13:57別拿DeepSeek攬Kimi的活。文 | 超聚焦Kimi K3,可能是月之暗面成立以來最接近“封神”的一次。在7月17日公佈的Artificial Analysis獨立測試中,K3以57分登上綜合智能指數全球第三,超過Claude Opus 4.

剛剛
IT之家生成式AI

Mac 版 Claude Code 集成 iOS 模擬器,可 AI 構建和測試 App

Anthropic 旗下官方帳號 @ClaudeDevs 於今日(7 月 22 日)在 X 平台發文宣布,Mac 桌面版 Claude Code 已正式內建整合 iOS 模擬器,開發者現在可以直接在模擬器中建構、執行與測試 iOS 應用程式,且過程中完全不需要額外授予螢幕錄製或輔助功能權限。這項功能目前以公測版本形式開放,官方已邀請開發者搶先體驗。

剛剛

大模型正在“變小”?

# 大模型正在“变小”:从云端下凡到终端的智能革命 在刚刚过去的WAIC 2026上,一个明显的风向转变正在发生:厂商不再像去年那样热衷于比拼模型参数规模和榜单跑分,反而集体谈论“模型能干什么”“能不能赚钱”。细心观察不难发现,几乎所有的参展商都在推广轻量化部署,纷纷拿出自家的“mini版”大模型。曾几何时,我们习惯了让手机语音助手在电梯里失灵、让汽车导航在隧道里沉默、让相册里的AI修图因断网变成灰色图标——真正的智能似乎永远依赖那朵“云”。

剛剛