跳转到内容
主站 新闻 控制台

推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

· DeepMind
DeepMind

2026 年 7 月 21 日

我们的最新 Gemini 模型具备高效的 Token 使用率、低延迟和可靠性能,助力大规模构建 AI Agent。

开发者和客户在构建生产级 AI Agent 时,需要更高的 Token 使用效率、更低的延迟以及更可靠的性能。我们的 Flash 系列模型旨在在效率与质量之间取得最佳平衡,从而支持 Agent 工作流的规模化。基于 Gemini 3.5 Flash,我们推出了全新的 Gemini 模型:

  • 3.6 Flash:我们的主力模型,在代码编写、知识工作和多模态性能方面表现更佳。根据 Artificial Analysis Index,其输出 Token 使用量相比 3.5 Flash 减少了 17%;在 Datacurve 的 DeepSWE 等部分基准测试中,我们观察到最高可达 65% 的降幅,同时每个输出 Token 的成本更低。
  • 3.5 Flash-Lite:速度最快、成本效益最高的 3.5 系列模型。根据 Artificial Analysis Index,其输出速度达到每秒 350 个 Token,并且在 Agent 工作流中的表现显著优于此前几代 Flash-Lite 模型。
  • CodeMender 中的 3.5 Flash Cyber:成功的网络安全应用需要对模型和 Agent 基础设施进行精心编排。我们推出了一种全新的高效专业网络安全模型,并将其与 CodeMender 代码安全 Agent 配套使用,在前沿水平上实现了具有竞争力的性能。

除今天发布的模型外,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,我们计划在准备就绪后尽快向更广泛的用户开放。与此同时,我们的团队已经在专注于下一代模型的研发。我们已经启动了迄今为止最具雄心的预训练任务——Gemini 4,并对目前取得的进展感到振奋。

3.6 Flash:比 3.5 Flash 更高效、质量更佳

Gemini 3.6 Flash 直接基于开发者和客户对 3.5 Flash 的反馈打造。3.6 Flash 不仅在代码编写和知识工作方面实现了提升,同时还显著提高了 Token 使用效率。例如,在 Artificial Analysis Index 中,我们观察到 3.6 Flash 的输出 Token 消耗量比 3.5 Flash 少 17%。在完成多步骤工作流时,它所需的推理步骤和工具调用次数也更少。

这种效率提升还伴随着比 3.5 Flash 更低的价格。3.6 Flash 的价格为输入 Token 每 100 万个 1.50 美元、输出 Token 每 100 万个 7.50 美元,降低了每项 Agent 任务的总体成本,让 Agent 的构建和运行更具成本效益。

3.6 Flash 在 OSWorld 验证任务(API)中展现出比 3.5 Flash 更高的 Token 使用效率和更少的冗余输出。

即使效率更高,3.6 Flash 在各类应用场景中的性能仍较 3.5 Flash 有所提升:

  • 在 DeepSWE 中,3.6 Flash 通过减少不必要的代码修改和执行循环,实现了更高的准确率(49% 对比 37%);在 MLE Bench 中,它在机器学习研究方面也取得了显著提升(63.9% 对比 49.7%)。
  • 在 OSWorld-Verified 中,其计算机操作能力有所提升(83.0% 对比 78.4%)。如今,计算机操作已作为内置客户端工具,通过 Gemini API 和 Gemini Enterprise 提供。
  • 在知识工作方面,3.6 Flash 的表现优于 3.5 Flash,GDPval-AA v2 等基准测试的成绩为 1421 对 1349。Hebbia 和 Harvey 等客户发现,它尤其擅长文档解析、图表与数据分析以及报告起草等多模态任务。

客户反馈称,3.6 Flash 在成本和质量方面都实现了提升,能够在复杂工作流和知识型任务中兼顾 Token 使用效率、准确性与速度:

以安全为基础构建

3.6 Flash 发布时配备了增强版的 前沿安全(Frontier Safety) 防护措施,覆盖化学、生物、放射性和核(CBRN)领域以及网络攻击滥用场景。这些防护措施使模型显著增强了抵御越狱攻击的能力。同时,模型经过训练,能够在有益的使用场景中尽量减少拒答。

更多信息请参阅 3.6 Flash 模型卡片。

3.5 Flash-Lite:为 Agent 工作流规模化而打造

除 Flash 系列外,我们还发布了 Gemini 3.5 Flash-Lite,专为低延迟任务以及对高吞吐量至关重要的开发者工作流而设计,例如 Agent 搜索和文档处理。

3.5 Flash-Lite 是 3.5 系列中速度最快的模型。根据 Artificial Analysis 的测量结果,其运行速度达到每秒 350 个输出 Token。3.5 Flash-Lite 的价格为输入 Token 每 100 万个 0.3 美元、输出 Token 每 100 万个 2.5 美元;相比 3.1 Flash-Lite,其质量显著提升。对于运行高吞吐量生产流量的开发者和客户而言,3.5 Flash-Lite 提供了出色的性价比。

3.5 Flash-Lite 执行高容量任务时,延迟低于 3.5 Flash。

3.5 Flash-Lite 支持 Agent 系统高效扩展。在不同的思考级别下,该模型的表现都显著优于 3.1 Flash-Lite。根据工作负载的不同,开发者可以将模型配置为使用最低或较低思考级别,以低延迟、低成本执行高容量任务;也可以启用更高的思考级别,处理多步骤子 Agent 工作负载。如今,该模型还将计算机操作作为内置工具,能够在各种场景中可靠地支持这些 Agent 任务。

在代码编写和 Agent 任务方面,3.5 Flash-Lite 实现了显著提升,Terminal-Bench 2.1 的成绩为 54% 对比 31%;在长上下文方面,GDM-MRCR v2 的成绩为 72.2% 对比 60.1%;在现实世界任务执行方面,GDPval-AA v2 的成绩为 1140 对比 642%。

事实上,在许多 Agent 和代码评测中,3.5 Flash-Lite 的表现甚至优于 3 Flash,包括 SWE-Bench Pro(54.2% 对比 49.6%)。