Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,用于以更高 token 效率、更低延迟和更可靠表现规模化构建 AI 智能体。
官方把三款新模型相对前代的token用量、速度、价格和基准分数放在一起,便于比较它们在智能体工作流里的成本与能力取舍。
Jul 21, 2026
|
我们最新的 Gemini 模型提供大规模构建 AI 智能体所需的效率、延迟和可靠性。
构建生产级 AI 智能体的开发者和客户需要更高的 token 效率、更低的延迟以及更可靠的性能。我们的 Flash 系列模型旨在达到效率与质量的最佳平衡点,从而支持智能体工作流的规模化扩展。在 Gemini 3.5 Flash 的基础上,我们推出新的 Gemini 模型:
- 3.6 Flash:我们的主力模型,在编程、知识工作和多模态性能方面表现更佳。根据 Artificial Analysis Index,与 3.5 Flash 相比,它将输出 token 用量减少了 17%;在 Datacurve 的 DeepSWE 等部分基准测试中,我们观察到最高可减少 65%,且每个输出 token 的成本更低。
- 3.5 Flash-Lite:我们最快、最具成本效益的 3.5 级模型,根据 Artificial Analysis Index,每秒可输出 350 个 token,同时在智能体工作流中也显著优于此前的 Flash-Lite 各代。
- CodeMender 中的 3.5 Flash Cyber:成功的网络安全应用需要将模型与智能体基础设施进行审慎编排。我们推出的组合包括一款全新、高效、专注网络安全的专用模型,并与我们的 CodeMender 代码安全智能体搭配,在前沿提供具有竞争力的性能。
除了今天发布的内容,Gemini 3.5 Pro 目前正与合作伙伴进行测试,我们计划在其准备就绪后尽快广泛提供。与此同时,我们的团队已专注于打造下一代模型。我们已经启动了迄今最具雄心的预训练运行,面向 Gemini 4,并对进展感到振奋。
3.6 Flash:比 3.5 Flash 更高效、质量更好
Gemini 3.6 Flash 直接建立在开发者和客户对 3.5 Flash 的反馈之上。3.6 Flash 不仅在编程和知识工作方面更进一步,同时还显著提升了 token 效率。例如,在 Artificial Analysis Index 上,我们看到 3.6 Flash 消耗的输出 token 比 3.5 Flash 少 17%。它完成多步骤工作流所需的推理步骤和工具调用也更少。
这种更高的效率还伴随着低于 3.5 Flash 的价格。价格为 $1.50/1M 输入 token 和 $7.50/1M 输出 token,3.6 Flash 降低了每项智能体任务的总体成本,使智能体的构建和运行更具成本效益。
在一项 OSWorld 已验证任务(API)中,3.6 Flash 展现出比 3.5 Flash 更好的 token 效率,并降低了冗长度
即便更加高效,3.6 Flash 在各类用例中相较 3.5 Flash 仍实现了性能提升:
- 3.6 Flash 以更少的不必要代码编辑和更少的执行循环实现更高精度,如 DeepSWE 所示(49% vs. 37%),并在机器学习研究方面显著提升,如 MLE Bench 所示(63.9% vs. 49.7%)。
- 它的计算机使用能力有所提升,如 OSWorld-Verified 所示(83.0% vs. 78.4%)。计算机使用现已成为通过 Gemini API 和 Gemini Enterprise 提供的内置客户端工具。
- 它在知识工作方面优于 3.5 Flash,如 GDPval-AA v2 等基准所示(1421 vs. 1349)。Hebbia 和 Harvey 等客户发现,它在文档解析、图表与数据分析以及报告起草等多模态任务上尤为出色。
客户表示,3.6 Flash 在成本和质量上都向前迈进了一步,在复杂工作流和基于知识的任务中平衡了 token 效率、准确性与速度:
以安全为先打造
3.6 Flash 现已配备增强的 Frontier Safety 防护措施,覆盖化学、生物、放射与核(CBRN)以及网络攻击滥用领域。这些防护措施使模型对越狱的抵抗力大幅提升。与此同时,该模型经过训练,以尽量减少对有益用途的拒绝。
更多信息请参阅 3.6 Flash 模型卡。
3.5 Flash-Lite:为规模化智能体工作流而打造
除 Flash 之外,我们还发布了 Gemini 3.5 Flash-Lite,专为低延迟任务以及开发者工作流中高吞吐量至关重要的任务而设计,例如智能体搜索和文档处理。
3.5 Flash-Lite 是 3.5 系列中最快的模型。据 Artificial Analysis 测量,其运行速度为 350 output tokens/s。定价为 $0.3/1M input tokens 和 $2.5/1M output tokens,且质量显著优于 3.1 Flash-Lite,3.5 Flash-Lite 为运行高吞吐量生产流量的开发者和客户提供了强劲的性价比。
3.5 Flash-Lite 以低于 3.5 Flash 的延迟执行大批量任务。
3.5 Flash-Lite 能够高效扩展智能体系统。在各个思考级别上,该模型都显著优于 3.1 Flash-Lite。根据工作负载,开发者可以将模型配置为:借助 minimal 和 low 思考级别,优先以低延迟、低成本执行大批量任务;或启用更高的思考级别来处理多步骤子智能体工作负载。该模型现在还将 computer use 作为内置工具,以可靠支持跨各类界面的这些智能体任务。
它在编程和智能体任务上有显著提升,如 Terminal-Bench 2.1(54% vs 31%)所示;在长上下文方面,如 GDM-MRCR v2(72.2% vs. 60.1%)所示;在真实世界任务执行方面,如 GDPval-AA v2(1140 vs. 642)所示。
事实上,在许多智能体和编程评测中,3.5 Flash-Lite 甚至优于 3 Flash,包括在 SWE-Bench Pro(54.2% vs. 49.6%)和 OSWorld-Verified(74.0% vs. 65.1%)上,使其成为同时适用于 2.5 和 3 Flash 工作负载的更快&更强选项。
3.5 Flash-Lite 的早期客户正在强调其在速度、智能和成本效率方面的独特组合,可用于规模化智能体工作流和数据处理任务:
有关该模型的更多信息,请参阅 3.5 Flash-Lite 模型卡。
CodeMender 中的 3.5 Flash Cyber:高效发现并修复漏洞
AI 模型发现安全漏洞的速度已经快于现有系统修复它们的速度。应对这一日益增长的威胁,需要一种能力强且高效的软件安全保障方法。
Flash 的性能和效率使其成为大规模检测、验证和修补代码安全问题的理想基础。Gemini 3.5 Flash Cyber 构建于 3.5 Flash 之上,并针对发现和修复网络安全漏洞进行了微调,每 token 价格低于更大的模型。
在 CodeMender 中,多个 3.5 Flash Cyber 智能体协同工作以生成一份合并报告,3.5 Flash Cyber 在热门基准测试 CyberGym 上达到了具有竞争力的前沿性能。
鉴于这项技术具有双重用途,我们在部署 3.5 Flash Cyber 时采取了审慎的方式。该模型即将作为有限访问试点计划的一部分,仅通过 CodeMender 向政府和可信合作伙伴提供。这将使一线防御者能够抢先发现并修复关键漏洞,赶在其被利用之前,同时降低更广泛滥用的风险。
3.6 Flash 与 3.5 Flash-Lite:即日起开始使用
3.6 Flash 与 3.5 Flash-Lite 即日起可用:
- 面向开发者:可通过 Google AI Studio 和 Android Studio 使用 Gemini API。3.6 Flash 也可在 Google Antigravity 中使用。请参阅 开发者指南 开始使用。
- 面向企业:可在 Gemini Enterprise Agent Platform 中使用。3.6 Flash 也可在 Gemini Enterprise 应用 中使用。
- 面向所有人:可通过 Gemini 应用 使用。3.5 Flash-Lite 也正在 Google 搜索中推出。
在您开始使用 3.6 Flash 和 3.5 Flash-Lite 进行构建时,我们欢迎您的反馈,以改进未来的 Gemini 模型,并期待尽快发布 3.5 Pro。
在收件箱中获取 Google 的最新资讯
订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等内容。
您的信息将按照 Google 隐私政策。 使用。您可以随时选择退出。
来源:Google DeepMind · deepmind.google