跳转到内容
主站 新闻 控制台

# Gemini 3.5 Flash Cyber 介绍

· DeepMind
DeepMind

2026年7月21日|模型

Raluca Ada Popa 和 Four Flynn

谷歌多年来一直在网络安全领域投入,率先开展自动化漏洞发现,以保护全球代码库的安全。像 CodeMender 这样的代码安全智能体,能够自动发现并修复关键软件漏洞。但随着 AI 智能体发现漏洞的速度开始超过防御者修复漏洞的速度,要应对这一全球性威胁,就需要一种能力强、成本低且可扩展的方法。

今天,我们正在拓展长期以来为防御者提供更好准备的努力,推出 Gemini 3.5 Flash Cyber——一款基于 3.5 Flash 构建、经过微调的轻量级网络安全模型,能够快速高效地发现、验证和修补漏洞,在这些任务上比 Gemini 的主线 Flash 模型更有效。

Flash 的性能与效率,使其成为我们网络安全模型工作的理想基础。基于 Flash 构建的 3.5 Flash Cyber,提供了一种成本更低、能力更强的替代方案,可取代大型且昂贵的网络安全模型。

鉴于这项技术具有双重用途属性,我们在部署 3.5 Flash Cyber 时采取了审慎的方式。作为一项有限访问的试点计划的一部分,3.5 Flash Cyber 即将通过 CodeMender 仅向政府和可信合作伙伴开放,并将随着时间推移逐步扩大。这将让一线防御者抢先一步,在漏洞被利用之前发现并修复关键漏洞,同时降低更广泛滥用的风险。

此外,我们还通过 Gemini Enterprise Agent Platform 将 CodeMender 的基础能力,直接提供给使用通用版 Gemini 模型的客户。

搜索空间问题:轻量级模型在代码安全中的优势

发现深层缺陷需要探索极其庞大的执行搜索空间。依赖单次昂贵的大模型调用,可能会形成瓶颈。3.5 Flash Cyber 尤其适合用于发现漏洞,因为在这类任务中,智能体必须扫描大型代码库并分析大量代码路径。

CodeMender 会多次调用 3.5 Flash Cyber,使智能体能够分析远更多的代码路径,从而发现并验证漏洞。随后,各个子智能体会生成一份单一的高质量报告。

得益于其速度和低成本,3.5 Flash Cyber 可以轻松集成到高频扫描、对时间敏感的发布流程或大规模提交扫描流水线中。

3.5 Flash Cyber 基准测试结果:大型网络安全模型之外的高效替代方案

我们在多项基准上测试了 3.5 Flash Cyber。尤其是,我们在 CyberGym 基准上测试了 3.5 Flash Cyber。该基准用于评估 AI 智能体应对数百个真实世界软件漏洞的能力。通过让 CodeMender 在生成一份最终报告时最多调用 3.5 Flash Cyber 五次,充分利用其低成本优势,整体智能体在 CyberGym* 上取得了可与显著更大模型相媲美的表现。

CyberGym 成功率(pass@1)

*竞争对手结果来源于厂商自报分数

我们还在没有安全护栏的情况下,对模型能力进行了超出 CyberGym 范围的压力测试。Google 的 Big Sleep 团队独立构建了一个评估体系,重点在于发现 Chrome 和 Safari 等全球最复杂代码库中的关键且难以发现的漏洞。在这里,3.5 Flash Cyber 的表现明显优于主线 3.5 Flash 和 3.6 Flash。

Big Sleep 评估成功率(pass@1)

3.5 Flash Cyber 还在 Google Chrome 的生产提交扫描流水线中接受了评估。相关漏洞未公开披露,这确保了该基准对 Gemini 和竞争对手模型保持“无污染”。

结果显示,与 3.5 Flash 相比,3.5 Flash Cyber 有显著提升。注意:Opus 4.6 之后更近的竞争对手模型版本由于内置安全护栏会拒绝执行这些任务,因此未纳入展示。

Chrome 生产提交扫描流水线成功率(pass@1)

此外,与主线 3.5 Flash 和 Claude Opus 4.6 相比,3.5 Flash Cyber 持续发现更多独特漏洞。在对高度复杂的 V8 JavaScript 引擎进行固定次数调用的测试中,3.5 Flash Cyber 发现了 55 个独特且已确认的问题,而主线 3.5 Flash 发现了 47 个,Opus 4.6 发现了 36 个,其中还有 10 个问题是另外两款被测试模型没有捕捉到的。

基础网络安全模型有时会陷入循环,反复发现同一个问题,却漏掉关键漏洞。强大的模型会更广泛地覆盖,发现更多独特问题。

随着调用次数增加,我们发现 3.5 Flash Cyber 会持续发现新的代码路径和漏洞。

现实世界应用,以及在 Google 规模化强化防御

基准测试只是故事的一部分。CodeMender 中的 3.5 Flash Cyber 已经在 Google 的内部代码库中发现并修复漏洞,这些代码库包括 Chrome、Android、Cloud、Ads 和 YouTube。

轻量级模型带来的更快发现速度,已经产生了可衡量的影响。

例如,Google 的 Cloud Vulnerability Research 团队使用 3.5 Flash Cyber 以前所未有的速度主动保护我们的系统。仅用 2 小时,模型就发现了公共 API 中的远程代码执行漏洞,并找到了一个敏感生产服务中的内存破坏漏洞。随后,它还生成了一个 100% 可靠的远程代码执行利用代码,绕过了诸如地址空间布局随机化(Address Space Layout Randomization,ASLR)和 Write XOR Execute(W^X)等标准缓解技术。

来自 Wiz 以及 Cloud CISO Security Engineering 测试人员的早期反馈证实,3.5 Flash Cyber 的能力相较主线 3.5 Flash 模型有显著提升。

赋能大规模防御者

Google 在软件安全领域的领导地位让我们拥有独特优势。例如,由 Google 运营的漏洞数据库 OSV.dev,涵盖超过 70 万个开源漏洞,以及超过 10 年的 OSS-Fuzz 结果,都帮助我们识别出质量最高的漏洞。

这使我们能够超越合成网络安全示例,教会模型真实安全专业人员的工作方式。我们的模型学会了操作行业标准工具,阅读 Chromium 这类大规模项目中的数百万行代码,并独立处理需要数小时连续深度分析的复杂安全任务。

通过用 3.5 Flash Cyber 为 CodeMender 提供支持,我们正在打造一种能力强、可扩展且经济实惠的架构,旨在帮助更多防御者保护软件安全。