meta-llama/PurpleLlama

Set of tools to assess and improve LLM security.

何を解決するか

Purple Llama は、オープンな生成型AIモデルを責任ある形で構築するためのコミュニティを支援するための統合プロジェクトです。LLMに関連するリスク、特にサイバーセキュリティ脅威、悪意のあるプロンプト、および不安全なコードの生成に対処するために、リスクを軽減するためのツールと評価のセットを提供します。

仕組み

このプロジェクトは「パープルチーム」アプローチを採用しており、攻撃(レッドチーム)と防御(ブルーチーム)の戦略を組み合わせてリスクを評価・軽減します。主に以下の3つのカテゴリのツールを提供します:

  • システムレベルのセーフガードLlama Guard(違反コンテンツを検出するモデレーションモデル群)、Prompt Guard(プロンプトインジェクションや jailbreak を防ぐ)、および Code Shield(推論時にLLMが生成する不安全なコードをフィルタリング)
  • 評価とベンチマークCyberSec Eval シリーズ(v1、v2、v3)は、業界標準のベンチマークを提供し、サイバーセキュリティリスクを定量化し、コードインタプリタの悪用傾向を測定し、視覚的プロンプトインジェクションやスパイフィッシング能力をテストします。

対象ユーザー

オープンな生成型AIモデルをデプロイする開発者や研究者で、アプリケーションの信頼性・安全性を確保し、コンテンツガイドラインに準拠するための信頼・安全・セキュリティ層を実装する必要がある人。

主な特徴

  • Llama Guard 3:多言語対応、128kのコンテキスト窓、画像推論をサポートする高パフォーマンスなモデレーションモデル
  • Prompt Guard:プロンプトインジェクションやjailbreakの試みを検出・ブロックする専用ツール
  • Code Shield:推論時フィルタリングにより、不安全なコードの実行やコードインタプリタの悪用を防止
  • CyberSec Eval:CWEおよびMITRE ATT&CKなどの業界標準に基づく、LLMのサイバーセキュリティリスクを評価する包括的なベンチマークセット

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch