OpenAI Aardvark: エージェント型セキュリティリサーチャー
OpenAIは、GPT-5を駆動する自律型エージェント型セキュリティリサーチャーであるAardvarkを発表しました。Aardvarkは、開発者とセキュリティチームがスケールでソフトウェアの脆弱性を発見し修正するのを支援するように設計されており、ソフトウェアセキュリティのバランスを防御側に有利にシフトさせます。
Aardvarkの脆弱性発見における技術的アプローチ
Aardvarkは、ソフトウェア構成分析やファズzingなどの従来のプログラム解析手法に依存しません。代わりに、LLM駆動の推論とツール使用を用いて、人間のセキュリティリサーチャーと同様にコードの動作を分析します-コードを読み、分析し、テストを実行します。
脆弱性を特定し解決するため、Aardvarkはマルチステージパイプラインを採用しています:
- 分析: エージェントは、プロジェクトの設計とセキュリティ目標に基づいて脅威モデルを作成するために、リポジトリ全体を分析することから始めます。
- コミットスキャン: Aardvarkは、確立された脅威モデルに基づいてリポジトリとコミットレベルの変更を監視します。新しいリポジトリについては、既存の問題を特定するために履歴全体をスキャンします。調査結果は、人間のレビューのために注釈付きコードとともにステップバイステップの説明として提示されます。
- 検証: 偽陽性を最小限に抑えるため、Aardvarkは特定された脆弱性を隔離されたサンドボックス環境でトリガーし、その悪用可能性を確認しようとします。
- パッチング: AardvarkはOpenAI Codexと統合してパッチを生成します。各調査結果には、Codexが生成しAardvarkがスキャンしたパッチが添付され、人間のレビュワーが効率的にワンクリックでパッチ適用できるようになります。
セキュリティの脆弱性以外にも、テストによりAardvarkはロジックの欠陥、プライバシー問題、および不完全な修正も特定できることが示されています。
パフォーマンスと実際の影響
Aardvarkは、OpenAIの内部コードベースおよび外部のアルファパートナーにわたって導入されています。"golden" リポジトリでのベンチマークテストにおいて、Aardvarkは既知および合成的に導入された脆弱性の92%を特定しました。
オープンソースエコシステムにおいて、Aardvarkはすでに多数の脆弱性を発見しており、そのうち10件はCommon Vulnerabilities and Exposures (CVE)識別子が割り当てられています。オープンソースサプライチェーンを支援するため、OpenAIは選択された非営利オープンソースリポジトリに対してプロボノスキャンを提供する計画です。
システムリスクとディフェンダーファーストモデル
ソフトウェアの脆弱性は、2024年に報告された40,000件以上のCVEがあるように、グローバルインフラストラクチャに対するシステムリスクを表しています。OpenAIは、約1.2%のコミットがバグを導入することを指摘しており、小さな変更から大きなリスクが生じることを示しています。 Aardvarkは、コードの進化に合わせて継続的な保護を提供することでディフェンダーファーストモデルを実装します。GitHub、Codex、および既存の開発者ワークフローと統合することにより、イノベーションの速度を損なうことなくセキュリティを強化することを目指しています。
可用性と進化
Aardvarkは当初、検出精度とレポートを改善するために選択されたパートナー向けにプライベートベータとしてローンチされました。2026年3月6日現在、AardvarkはCodex Securityに進化しており、これはリサーチプレビューとして利用可能です。Codex SecurityはCodexに直接統合され、Codex webを通じてChatGPT Enterprise、Business、およびEduのお客様に段階的に提供されています。