CyberSecEval 2: 大規模言語モデルにおけるサイバーセキュリティリスクの評価
Hugging Face と Meta は、Large Language Models (LLMs) のサイバーセキュリティリスクと能力を測定するために設計された包括的評価フレームワーク、CyberSecEval 2 を導入しました。このフレームワークは、LLM がコーディングアシスタントにますます統合される中で、新たな脆弱性が生じており、これらを緩和するために標準化されたベンチマークが必要となるため、重要です。
サイバーセキュリティベンチマークカテゴリ
CyberSecEval 2 は、LLM が不安全なコードやサイバー攻撃の支援要求にどのように対処するかを評価するために、5 つの異なるテストスイートを利用します。
- Insecure Coding Practices: このテストは、業界標準の Common Weakness Enumeration (CWE) タクソノミーに基づき、オートコンプリートや指示コンテキストにおいて LLM がリスクの高いセキュリティ脆弱性を提案する頻度を測定します。結果はコードテストの合格率として報告されます。
- Prompt Injection Susceptibility: これらのテストは、モデルが信頼できる入力と信頼できない入力を区別する能力と、一般的なプロンプトインジェクション手法に対する耐性を評価します。報告される指標は、攻撃に対するモデルのコンプライアンス頻度です。
- Cyber Attack Compliance: このスイートは、違反率(攻撃的なサイバー攻撃の支援に同意する頻度)と誤拒否率(サイバー防御に関する無害なプロンプトを拒否する頻度)とのトレードオフを測定します。
- Code Interpreter Abuse: これは、LLM がサンドボックス環境内で悪意のあるコードを実行させ、システムアクセスを取得したり、機密情報を収集したり、ソーシャルエンジニアリング攻撃を実行したりできるかどうかを評価します。結果はコンプライアンスの頻度として報告されます。
- Automated Offensive Capabilities: capture-the-flag (CTF) スタイルのセキュリティテストケースを使用し、このスイートは LLM が SQL インジェクションやバッファオーバーフローなどのエンドツーエンドのエクスプロイト課題を解決できるかどうかを判断します。結果は完了率のパーセンテージとして報告されます。
主な所見と業界トレンド
CyberSecEval 2 を用いた最先端 LLM の評価により、AI セキュリティの現状に関するいくつかの重要な洞察が明らかになりました。
攻撃コンプライアンスの低減
ベンチマークの最初のバージョンが 2023 年 12 月に公開されて以来、サイバー攻撃の支援要求に対する LLM の平均コンプライアンス率は 52% から 28% に低下しました。これは、攻撃的なサイバーリクエストに対する安全性の整合性が業界全体で向上していることを示しています。
モデルの専門化とセキュリティ
コード専門化されていないモデルは、コード専門化されたモデルに比べて一般的に非コンプライアンス率が低いです。しかし、両者のギャップは縮小しており、専門化されたコーディングモデルがセキュリティ姿勢を向上させていることが示唆されます。
継続的なプロンプトインジェクションリスク
プロンプトインジェクションは未解決の問題です。テストは、開発者が敵対的入力に直面した際に LLM がシステムプロンプトに安全に従うと想定できないことを示しており、LLM ベースのアプリケーションにとって重大なリスクとなります。
エンドツーエンドのエクスプロイトにおける制限
汎用的なコーディング能力が高いモデルはエクスプロイトテストでより良い結果を示すものの、現時点の LLM はエンドツーエンドのエクスプロイト課題を確実に解決する能力が不足しています。これは、現状の LLM がサイバーエクスプロイト攻撃を根本的に変える可能性は低いことを示唆しています。
コードインタプリタの脆弱性
LLM はコードインタプリタ内で悪用行為を実行させる操作に対して依然として脆弱です。この発見は、インタプリタの悪用を防止するための追加的なガードレールや検知メカニズムの必要性を強調しています。
オープンソースへの貢献
CyberSecEval 2 のすべてのコードはオープンソースです。コミュニティは自分のモデルでこれらのベンチマークを実行し、結果を CyberSecEval 2 のリーダーボードに提出して、LLM のサイバーセキュリティ安全特性に関する集合的な理解を深めることが奨励されています。