Gemini 3.5 Flash Cyber リリースノート

Gemini 3.5 Flash Cyber リリースノート

Google DeepMind は、ソフトウェアの脆弱性を見つけ、検証し、パッチを適用するために特別にファインチューンされた軽量モデルである Gemini 3.5 Flash Cyber をリリースしました。モデルサイズよりも効率と速度を優先することで、このモデルは防御者がより大きなコードベースをスキャンし、より多くの実行パスをより迅速に分析できるようにします。これは、より大きくて高価なモデルでは不可能です。

高効率の脆弱性発見

Gemini 3.5 Flash Cyber は、コードセキュリティにおける「探索空間問題」に対処します。深層に潜む欠陥を見つけるためには、膨大な数の実行パスを探索する必要があります。このモデルは軽量で手頃な価格であるため、CodeMender のようなエージェントによって複数回呼び出すことができ、単一の高品質なレポートを生成する前に、はるかに多くのコードパスを分析することが可能です。

このアーキテクチャにより、モデルは次のものに統合できます:

  • 頻繁なセキュリティスキャン
  • 時間に敏感なリリースプロセス
  • スケールでのコミットスキャンパイプライン

パフォーマンスベンチマーク

Gemini 3.5 Flash Cyber は、いくつかの専門的な評価において、より大きなモデルと競合するパフォーマンスを示しています:

CyberGym ベンチマーク

CyberGym ベンチマークは、実際のソフトウェアの脆弱性に対して AI エージェントを評価するもので、5 回まで 3.5 Flash Cyber を呼び出すように設定された CodeMender は、はるかに大きなモデルと競合するパフォーマンスを達成しました。

Big Sleep 評価

Google の Big Sleep チームによる独立した評価では、Chrome や Safari といった複雑なコードベースにおける重大な脆弱性に焦点を当て、3.5 Flash Cyber はメインラインの 3.5 Flash と 3.6 Flash モデルのパフォーマンスを大きく上回りました。

Chrome 本番コミットスキャン

Google Chrome の本番コミットスキャンパイプラインでのテストでは、3.5 Flash Cyber は 3.5 Flash に対して大幅な向上を示しました。レポートによると、より新しい競合モデル(Opus 4.6 以降)は、組み込まれた安全ガードレールのためタスクを拒否しました。

V8 JavaScript Engine テスト

V8 JavaScript Engine でのテストでは、3.5 Flash Cyber は固定された呼び出し回数の中で 55 件の一意の確認済み問題を発見しました。これに対し、メインラインの 3.5 Flash は 47 件、Claude Opus 4.6 は 36 件でした。これには、他の二つのモデルがいずれも特定しなかった 10 件の問題が含まれています。

実際のアプリケーションと導入

Gemini 3.5 Flash Cyber は、Android、Chrome、Cloud、Ads、YouTube などの Google 内部コードベースで既に使用されています。

あるケースでは、Google の Cloud Vulnerability Research チームがこのモデルを使用して、公開 API のリモートコード実行の脆弱性と、敏感な本番サービスにおけるメモリ破損の脆弱性を 2 時間以内に発見しました。その後、このモデルは Address Space Layout Randomization (ASLR) や Write XOR Execute (W^X) といった標準的な緩和策を回避する 100% 信頼性のあるリモートコード実行エクスプロイトを生成しました。

アクセスと可用性

この技術のデュアルユース性質により、Google は限定アクセスのパイロットプログラムを通じて 3.5 Flash Cyber を展開しています。これは、政府および信頼できるパートナーに対して、CodeMender を介して exclusivamente 提供されます。

別途、CodeMender の基盤となる機能は、Gemini Enterprise Agent Platform を通じてお客様に一般的に提供されています。

Sources