Firefox のハードニング:Mozilla が Claude Mythos を活用して数百件のセキュリティバグを根絶した方法

何年もの間、オープンソースのメンテナは AI 生成バグレポートとの関係に苦慮してきました。LLM がセキュリティ脆弱性を探す初期の試みは、しばしば「スロップ」――見た目は妥当だが根本的に誤っているレポート――を生み、開発者が数時間かけて些細な幻覚を検証しなければならないという非対称なコストを課していました。

しかし、Mozilla は最近、パラダイムシフトを発表しました。Claude Mythos Preview のようなモデルの進化する能力と高度な エージェント型ハーネス を組み合わせることで、Firefox に潜む前例のない数の潜在的セキュリティバグを特定し修正しました。この取り組みは、静的解析から動的で AI 主導のハードニングパイプラインへの転換を示しており、脆弱性を仮説として提示するだけでなく、再現可能なテストケースで実証できるようになっています。

AI バグハンティングの進化

Mozilla の取り組みは、GPT-4 や Sonnet 3.5 といったモデルを用いたシンプルな静的解析から始まりました。有望ではありましたが、初期の実験は高い偽陽性率に悩まされ、大規模展開には実用的ではありませんでした。転機となったのは エージェント型ハーネス の実装です。

標準的な LLM プロンプトとは異なり、エージェント型ハーネスはプロジェクトの既存インフラ(ここでは Mozilla のファジングシステム)と統合されています。これにより AI は次のことが可能になります。

  1. Hypothesize: コード内の潜在的脆弱性を特定する。
  2. Test: 再現可能なテストケースを作成・実行し、バグが実際に発生するか確認する。
  3. Verify: 再現できない推測を排除し、実際のバグを確定する。

このループが洗練されると、Mozilla はエフェメラル VM 上でジョブを並列化し、各 VM が特定ファイルを対象に結果を集中バケットへ書き込むことでプロセスをスケールさせました。これにより LLM は単なるアドバイザーから、重複排除、トリアージ、出荷プロセスと統合されたセキュリティバグライフサイクルの機能的な一部へと変貌しました。

深掘り:AI が見つけたもの

発見されたバグの多様性は、AI が複雑でマルチプロセスなブラウザエンジンコードを推論できることを示しています。多くは「サンドボックスエスケープ」で、従来のファザーでは検出が極めて困難です。これは単なるメモリ破壊ではなく、特定のロジックギャップを突く必要があるためです。

いくつかの顕著な例は以下の通りです。

  • Logic and Edge Cases: <legend> 要素における 15 年前のバグで、再帰スタック深度制限とサイクルコレクションの綿密なオーケストレーションにより発生しました。
  • IPC Vulnerabilities: Inter-Process Communication (IPC) 上のレースコンディションにより、侵害されたコンテンツプロセスが親プロセスの IndexedDB 参照カウントを操作し、Use-After-Free (UAF) を引き起こしました。
  • Memory Safety: IPC 境界を越える生の NaN がタグ付けされた JS オブジェクトポインタとして偽装し、サンドボックスエスケープ用の偽オブジェクトプリミティブを生成しました。
  • Legacy Code: key() の再入呼び出しがハッシュテーブルの再ハッシュを誘発し、ポインタがまだ使用中にもかかわらずバックストアが解放されるという 20 年前の XSLT バグです。

興味深いことに、Mozilla は AI が 特定のバグを見つけられなかった 事例も観測しました。モデルは何度もプロトタイプ汚染を用いてサンドボックスから脱出しようと試みましたが、Mozilla が以前に実装したデフォルトでプロトタイプを凍結するアーキテクチャ変更に阻まれました。これは既存のディフェンス・イン・デプス戦略が有効であることの有意義な検証となりました。

パイプラインのスケーリング

Mozilla のアプローチは LLM を交換可能なプリミティブとして扱います。まずパイプラインを構築したことで、Claude Mythos Preview へのシームレスなアップグレードが可能となり、バグ検出、PoC 作成、脆弱性の病理説明能力が向上しました。

インパクトの規模は数字で明らかです。2026 年 4 月だけで Mozilla は 423 件のセキュリティバグを修正しました。そのうち Firefox 150 リリース向けに Claude Mythos Preview が特定したのは 271 件です。これら 271 件の深刻度内訳は以下の通りです。

  • sec-high: 180
  • sec-moderate: 80
  • sec-low: 11

業界への影響と反論

このパイプラインの成功は、ソフトウェアセキュリティの未来について広範な議論を呼び起こしています。一部の開発者は、これが従来のゼロデイの終焉の始まりだと主張する一方で、別の開発者は人間要素への懸念を表明しています。

コミュニティの議論では以下の重要な点が挙げられています。

  • The Human Element: プロジェクトが人間が作成したバグレポートを無視し、AI 生成レポートに偏る恐れがあり、長年残っている手動レポートが放置される可能性があります。
  • Tooling Shifts: エージェント型 AI が従来の静的解析ツールを最終的に置き換えるのではないかという推測があります。これらのツールはしばしば遅く、偽陽性が多いです。
  • Sustainability: こうした大規模なクリーンアップが持続可能な実践なのか、AI プロバイダーとのパートナーシップによる一時的な「マーケティングユースケース」に過ぎないのかという疑問が提起されています。

開発者への教訓

Mozilla は他のソフトウェアプロジェクトにも、同様のハーネス導入を今すぐ始めることを推奨しています。コアとなる「インナーループ」はシンプルです:コードの一部を特定し、モデルにバグ探索を促し、テストケースの構築を要求して実証させます。このインフラを早期に整備すれば、現在のモデルから即座に恩恵を受け、より高度なモデルが登場した際に自動的にセキュリティ体制をスケールさせることができます。

Mozilla は今後、解析を Continuous Integration (CI) システムに直接組み込み、パッチがツリーに取り込まれるたびにスキャンし、最初から新たな脆弱性が導入されるのを防ぐ計画です。

Sources