跳转到内容
主站 新闻 控制台

推出 Gemini 3.5 Flash Cyber

· DeepMind
DeepMind

2026 年 7 月 21 日 模型

Raluca Ada Popa 和 Four Flynn

多年来,Google 一直持续投入网络安全领域,率先探索自动化漏洞发现技术,以保护全球代码库。我们的代码安全代理 CodeMender 等工具能够自动发现并修复关键软件漏洞。但随着 AI 代理发现漏洞的速度逐渐超过防御者修复漏洞的速度,要应对这一全球性威胁,就需要一种能力强大、价格可负担且可扩展的方法。

今天,我们进一步扩展长期以来帮助防御者做好准备的工作,推出 Gemini 3.5 Flash Cyber。这是一款基于 3.5 Flash 构建的轻量级网络安全模型,经过微调,能够快速高效地发现、验证和修补漏洞。在这些任务上的表现优于 Gemini 的主线 Flash 模型。

Flash 的性能和效率使其成为我们构建网络安全模型的理想基础。基于 Flash 构建的 3.5 Flash Cyber,为大型且昂贵的网络安全模型提供了一种高性价比、能力强大的替代方案。

鉴于这项技术具有双重用途,我们对 3.5 Flash Cyber 的部署方式采取了审慎的策略。作为有限访问试点计划的一部分,3.5 Flash Cyber 很快将通过 CodeMender 专门向政府机构和受信任的合作伙伴提供,并逐步扩大范围。这将帮助一线防御者抢占先机,在关键漏洞遭到利用之前发现并修复它们,同时降低更广泛滥用的风险。

此外,我们还将通过 Gemini Enterprise Agent Platform,直接向客户提供搭载通用 Gemini 模型的 CodeMender 基础能力。

搜索空间问题:轻量级模型在代码安全领域的优势

发现深层次漏洞需要探索巨大的执行搜索空间。依赖一次昂贵的大型语言模型调用,可能会造成瓶颈。3.5 Flash Cyber 尤其适合用于发现漏洞,因为在这类任务中,代理需要扫描大型代码库并分析大量代码路径。

CodeMender 会多次调用 3.5 Flash Cyber,使代理能够分析数量多得多的代码路径,从而发现并验证漏洞。随后,多个子代理会生成一份高质量的综合报告。

得益于速度快、成本低,3.5 Flash Cyber 可以轻松集成到高频扫描、时间敏感型发布流程或大规模提交扫描流水线中。

3.5 Flash Cyber 基准测试结果:大型网络安全模型的高效替代方案

我们在多种基准测试上对 3.5 Flash Cyber 进行了测试。特别是,我们在 CyberGym 基准测试上对其进行了评估。该基准测试用于评估 AI 代理应对数百个真实世界软件漏洞的能力。通过利用 3.5 Flash Cyber 的低成本,将 CodeMender 配置为针对单份最终报告最多调用 3.5 Flash Cyber 五次,整个代理在 CyberGym 上的表现足以与规模大得多的模型相竞争*。

CyberGym 成功率(pass@1)

*竞争对手的结果来自其提供商自行报告的分数

我们还在没有安全防护措施的情况下,对模型在 CyberGym 之外的能力进行了压力测试。Google Big Sleep 团队独立构建了一项评估,重点测试模型在 Chrome 和 Safari 等全球最复杂的代码库中发现关键且隐蔽漏洞的能力。在这项评估中,3.5 Flash Cyber 的表现显著超过了主线 3.5 Flash 和 3.6 Flash。

Big Sleep 评估成功率(pass@1)

我们还在 Google Chrome 的生产提交扫描流水线上对 3.5 Flash Cyber 进行了评估。由于这些漏洞尚未公开披露,因此该基准测试不会受到 Gemini 和竞争对手模型训练数据污染的影响。

结果显示,与 3.5 Flash 相比,3.5 Flash Cyber 的性能有显著提升。注意:Opus 4.6 之后发布的较新竞争对手模型由于内置安全防护措施,会拒绝执行相关任务,因此未在此展示。

Chrome 生产提交扫描流水线成功率(pass@1)

此外,与主线 3.5 Flash 和 Claude Opus 4.6 相比,3.5 Flash Cyber 持续发现了更多独特漏洞。在固定调用次数下对高度复杂的 V8 JavaScript 引擎进行测试时,3.5 Flash Cyber 发现了 55 个经过确认的独特问题,而主线 3.5 Flash 发现了 47 个,Opus 4.6 发现了 36 个。其中有 10 个问题是另外两个受测模型都未能发现的。

基础网络安全模型可能会陷入循环,反复发现同一个问题,却遗漏关键漏洞。强大的模型能够扩大搜索范围,发现更多独特问题。

随着调用次数增加,我们发现 3.5 Flash Cyber 仍在持续发现新的代码路径和漏洞。

在 Google 的实际应用与防御规模化

基准测试只是整体情况的一部分。CodeMender 中的 3.5 Flash Cyber 已经在 Google 的内部代码库中发现并修复漏洞,涉及 Chrome、Android、Cloud、Ads 和 YouTube 等项目。

轻量级模型所带来的发现速度已经产生了可量化的影响。

例如,Google 云漏洞研究团队使用 3.5 Flash Cyber,以创纪录的速度主动保护我们的系统。在短短 2 小时内,该模型就在公共 API 中发现了远程代码执行漏洞,并在一项敏感的生产服务中发现了内存损坏漏洞。随后,它生成了一个 100% 可靠的远程代码执行漏洞利用程序,能够绕过地址空间布局随机化(Address Space Layout Randomization,ASLR)和写异或执行(Write XOR Execute,W^X)等标准缓解技术。

Wiz 和 Cloud CISO 安全工程测试人员的早期反馈证实,与主线 3.5 Flash 模型相比,3.5 Flash Cyber 的能力有了显著提升。

大规模赋能防御者

Google 在软件安全领域的领导地位为我们带来了独特优势。例如,由 Google 运营的漏洞数据库 OSV.dev 收录了超过 70 万个开源漏洞;此外,超过 10 年的 OSS-Fuzz 结果也帮助我们识别出质量最高的漏洞。

这使我们能够超越合成网络安全示例,教会模型真实安全专业人员的工作方式。我们的模型学会了操作行业标准工具,阅读 Chromium 等大型项目中数百万行代码,并独立处理需要数小时持续深度分析的复杂安全任务。

通过使用 3.5 Flash Cyber 为 CodeMender 提供支持,我们正在提供一种能力强大、可扩展且价格可负担的架构,旨在帮助更多防御者保护软件。