跳转到内容
主站 新闻 控制台

介绍 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

· DeepMind
DeepMind

2026年7月21日

我们最新的 Gemini 模型带来了构建大规模 AI 智能体所需的效率、低延迟和可靠性。

开发者和客户在构建生产级 AI 智能体时,需要更高的 token 效率、更低的延迟以及更可靠的性能。我们的 Flash 系列模型旨在在效率与质量之间找到最佳平衡,支持智能体工作流的规模化扩展。基于 Gemini 3.5 Flash,我们推出了新的 Gemini 模型:

  • 3.6 Flash:我们的主力模型,在编程、知识工作和多模态性能方面表现更佳。根据 Artificial Analysis Index,与 3.5 Flash 相比,它将输出 token 用量减少了 17%;在 Datacurve 的 DeepSWE 等某些基准上,我们观察到最高可减少 65%,且每个输出 token 的成本更低。
  • 3.5 Flash-Lite:我们最快、最具成本效益的 3.5 级模型。根据 Artificial Analysis Index,它每秒可输出 350 个 token,同时在智能体工作流中的表现也显著优于前代 Flash-Lite。
  • CodeMender 中的 3.5 Flash Cyber:成功的网络安全应用需要模型与智能体基础设施进行精心编排。我们推出了一种组合方案:一款全新、效率极高、专注于网络安全的专用模型,搭配我们的 CodeMender 代码安全智能体,在前沿任务上带来具有竞争力的表现。

除了今天发布的内容之外,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,我们计划在它准备就绪后尽快广泛提供。与此同时,我们团队已经在专注于构建下一代模型。我们已经启动了迄今为止最具雄心的预训练任务——Gemini 4,并对进展感到振奋。

3.6 Flash:比 3.5 Flash 更高效、质量更好

Gemini 3.6 Flash 直接基于 3.5 Flash 的开发者和客户反馈打造。3.6 Flash 不仅在编程和知识工作方面实现了提升,还显著改善了 token 效率。例如,在 Artificial Analysis Index 上,我们看到 3.6 Flash 的输出 token 消耗比 3.5 Flash 少 17%。它在完成多步骤工作流时,所需的推理步骤和工具调用也更少。

这种效率提升还伴随着比 3.5 Flash 更低的价格。输入 token 价格为每 100 万个 1.50 美元,输出 token 价格为每 100 万个 7.50 美元,3.6 Flash 降低了每项智能体任务的总体成本,使智能体的构建和运行更具成本效益。

3.6 Flash 在 OSWorld verified 任务中的 token 效率更高,且比 3.5 Flash 更精简(API)

即便在更高效的同时,3.6 Flash 相比 3.5 Flash 在多个用例上也实现了性能提升:

  • 3.6 Flash 在更少不必要代码修改和更少执行循环的情况下实现了更高精度,如 DeepSWE 所示(49% vs. 37%);在机器学习研究方面也有显著提升,如 MLE Bench 所示(63.9% vs. 49.7%)。
  • 它的计算机使用能力有所提升,如 OSWorld-Verified 所示(83.0% vs. 78.4%)。计算机使用现已通过 Gemini API 和 Gemini Enterprise 作为内置客户端侧工具提供。
  • 它在知识工作方面优于 3.5 Flash,基准如 GDPval-AA v2 所示(1421 vs. 1349)。Hebbia、Harvey 等客户发现,它在文档解析、图表和数据分析、报告撰写等多模态任务上尤其出色。

客户反馈称,3.6 Flash 在成本和质量两方面都迈出了重要一步,在复杂工作流和知识型任务中兼顾了 token 效率、准确性与速度:

安全性内建

3.6 Flash 以增强的 Frontier Safety 防护措施发布,覆盖化学、生物、辐射和核(CBRN)以及网络攻击滥用等领域。这些防护使该模型对越狱攻击的抵抗能力显著增强。同时,该模型经过训练,尽量减少对有益用途的拒答。

更多信息请参见 3.6 Flash 模型卡。

3.5 Flash-Lite:为智能体工作流规模化而生

除了 Flash 之外,我们还发布了 Gemini 3.5 Flash-Lite,专为低延迟任务和开发者工作流中高吞吐量至关重要的任务而设计,例如智能体搜索和文档处理。

3.5 Flash-Lite 是 3.5 系列中速度最快的模型。根据 Artificial Analysis 的测量,它的运行速度为每秒 350 个输出 token。其定价为每 100 万个输入 token 0.3 美元、每 100 万个输出 token 2.5 美元,并且质量显著优于 3.1 Flash-Lite,因此对于运行高吞吐量生产流量的开发者和客户来说,具有很强的性价比。

3.5 Flash-Lite 以比 3.5 Flash 更低的延迟执行大批量任务。

3.5 Flash-Lite 使智能体系统能够高效扩展。无论在何种思考级别下,该模型都显著优于 3.1 Flash-Lite。根据不同工作负载,开发者可以将模型配置为在 minimal 和 low 思考级别下优先执行低延迟、低成本的高批量任务,或启用更高思考级别来处理多步骤的子智能体工作负载。该模型现在还将计算机使用作为内置工具,可可靠地支持跨界面的这些智能体任务。

它在编程和智能体任务方面实现了显著提升,如 Terminal-Bench 2.1 所示(54% vs 31%);在长上下文方面也有提升,如 GDM-MRCR v2 所示(72.2% vs. 60.1%);在真实世界任务执行方面也更强,如 GDPval-AA v2 所示(1140 vs. 642)。

事实上,在许多智能体和编程评测中,3.5 Flash-Lite 甚至优于 3 Flash,包括 SWE-Bench Pro(54.2% vs. 49.6%)