2026 年 7 月 21 日 モデル
Raluca Ada Popa と Four Flynn
Google は長年にわたりサイバーセキュリティ分野への投資を続け、世界中のコードベースを守るため、自動化された脆弱性発見技術を率先して開拓してきました。当社のコードセキュリティエージェント CodeMender などのツールは、重大なソフトウェア脆弱性を自動的に発見・修正できます。しかし、AI エージェントが脆弱性を発見する速度が、防御側が脆弱性を修正する速度を上回りつつある現在、この世界的な脅威に対処するには、強力で手頃な価格、かつスケーラブルな手段が必要です。
本日、私たちはこれまで防御側の備えを支援してきた取り組みをさらに拡大し、Gemini 3.5 Flash Cyber を発表します。これは 3.5 Flash をベースに構築した軽量なサイバーセキュリティモデルで、脆弱性の発見、検証、修正を迅速かつ効率的に行えるようファインチューニングされています。これらのタスクにおいて、Gemini の標準 Flash モデルを上回る性能を発揮します。
Flash の性能と効率性は、サイバーセキュリティモデルを構築するための理想的な基盤となります。Flash をベースに構築された 3.5 Flash Cyber は、大規模で高コストなサイバーセキュリティモデルに代わる、費用対効果と能力に優れた選択肢です。
この技術がデュアルユースであることを踏まえ、3.5 Flash Cyber の展開には慎重な方針を採用しています。限定アクセスのパイロットプログラムの一環として、3.5 Flash Cyber は近日中に、CodeMender を通じて政府機関および信頼できるパートナーに限定提供され、その後、対象範囲を段階的に拡大していく予定です。これにより、最前線の防御担当者は先手を取り、重大な脆弱性が悪用される前に発見・修正できるようになります。同時に、より広範な悪用のリスクも抑制できます。
さらに、汎用 Gemini モデルを搭載した CodeMender の基盤機能を、Gemini Enterprise Agent Platform を通じて、お客様に直接提供します。
探索空間の問題:コードセキュリティにおける軽量モデルの優位性
深刻な脆弱性を発見するには、広大な実行探索空間を調査する必要があります。高コストな大規模言語モデルの呼び出しに依存すると、ボトルネックが生じる可能性があります。3.5 Flash Cyber は、こうしたタスクに特に適しています。エージェントは大規模なコードベースをスキャンし、膨大な数のコードパスを分析する必要があるためです。
CodeMender は 3.5 Flash Cyber を複数回呼び出すことで、エージェントがはるかに多くのコードパスを分析できるようにし、脆弱性の発見と検証を実現します。その後、複数のサブエージェントが高品質な統合レポートを作成します。
3.5 Flash Cyber は高速かつ低コストであるため、高頻度のスキャン、時間制約のあるリリースプロセス、大規模なコミットスキャンパイプラインにも容易に組み込めます。
3.5 Flash Cyber のベンチマーク結果:大規模なサイバーセキュリティモデルに代わる効率的な選択肢
私たちは、さまざまなベンチマークで 3.5 Flash Cyber を評価しました。特に、AI エージェントが数百件の実在するソフトウェア脆弱性に対処する能力を評価する CyberGym ベンチマークでテストを実施しました。3.5 Flash Cyber の低コストを活かし、最終レポート 1 件につき最大 5 回 3.5 Flash Cyber を呼び出すよう CodeMender を構成した結果、エージェント全体の CyberGym における性能は、はるかに大規模なモデルに匹敵するものでした*。
CyberGym 成功率(pass@1)
*競合モデルの結果は、各提供元が自己申告したスコアです
また、安全対策を施していない状態で、CyberGym 以外の環境におけるモデルの能力についてもストレステストを実施しました。Google Big Sleep チームは、Chrome や Safari など、世界で最も複雑なコードベースにおいて、重大かつ見つけにくい脆弱性を発見する能力を重点的に検証する評価を独自に構築しました。この評価では、3.5 Flash Cyber は標準の 3.5 Flash および 3.6 Flash を大きく上回りました。
Big Sleep 評価の成功率(pass@1)
さらに、Google Chrome の本番コミットスキャンパイプラインで 3.5 Flash Cyber を評価しました。これらの脆弱性はまだ一般公開されていないため、このベンチマークは Gemini や競合モデルの学習データによる汚染の影響を受けません。
結果から、3.5 Flash Cyber は 3.5 Flash と比較して大幅に性能を向上させていることが分かりました。注:Opus 4.6 より後にリリースされた新しい競合モデルは、組み込みの安全対策により関連タスクの実行を拒否するため、ここでは掲載していません。
Chrome 本番コミットスキャンパイプラインの成功率(pass@1)
さらに、標準の 3.5 Flash および Claude Opus 4.6 と比較して、3.5 Flash Cyber は一貫して、より多くの固有の脆弱性を発見しました。呼び出し回数を固定し、高度に複雑な V8 JavaScript エンジンを対象にテストしたところ、3.5 Flash Cyber は確認済みの固有の問題を 55 件発見しました。一方、標準の 3.5 Flash は 47 件、Opus 4.6 は 36 件でした。このうち 10 件は、評価対象となった他の 2 つのモデルがいずれも発見できなかった問題でした。
基盤となるサイバーセキュリティモデルは、同じ問題を繰り返し発見しながら、重大な脆弱性を見落とすというループに陥ることがあります。強力なモデルであれば探索範囲を広げ、より多くの固有の問題を発見できます。
呼び出し回数を増やすにつれて、3.5 Flash Cyber は新たなコードパスと脆弱性を発見し続けることが分かりました。
Google における実運用と防御の大規模展開
ベンチマークは全体像の一部にすぎません。CodeMender に搭載された 3.5 Flash Cyber は、すでに Google の内部コードベースで脆弱性を発見・修正しており、対象には Chrome、Android、Cloud、Ads、YouTube などのプロジェクトが含まれます。
軽量モデルによる発見速度の向上は、定量的な効果をもたらしています。
たとえば、Google のクラウド脆弱性研究チームは 3.5 Flash Cyber を使用し、記録的な速さでシステムをプロアクティブに保護しました。わずか 2 時間で、このモデルはパブリック API におけるリモートコード実行脆弱性を発見し、さらに機密性の高い本番サービスでメモリ破損の脆弱性を発見しました。その後、アドレス空間配置のランダム化(Address Space Layout Randomization、ASLR)や書き込み XOR 実行(Write XOR Execute、W^X)などの標準的な緩和策を回避できる、信頼性 100% のリモートコード実行エクスプロイトを生成しました。
Wiz および Cloud CISO のセキュリティエンジニアリングテスト担当者から寄せられた初期フィードバックでも、標準の 3.5 Flash モデルと比較して、3.5 Flash Cyber の能力が大幅に向上していることが確認されています。
防御担当者を大規模に支援
ソフトウェアセキュリティ分野における Google のリーダーシップは、私たちに独自の優位性をもたらします。たとえば、Google が運営する脆弱性データベース OSV.dev には、70 万件を超えるオープンソースの脆弱性が登録されています。また、10 年以上にわたる OSS-Fuzz の成果も、品質の高い脆弱性の特定に役立っています。
これにより、私たちは合成されたサイバーセキュリティの例を超えて、実際のセキュリティ専門家がどのように業務を行うかをモデルに学習させることができます。モデルは業界標準のツールを操作し、Chromium などの大規模プロジェクトに含まれる数百万行のコードを読み取り、数時間にわたる継続的で深い分析を必要とする複雑なセキュリティタスクにも自律的に対応できるようになりました。
3.5 Flash Cyber で CodeMender を支えることにより、より多くの防御担当者がソフトウェアを保護できるようにする、強力でスケーラブルかつ手頃な価格のアーキテクチャを提供していきます。