NVIDIA/garak

the LLM vulnerability scanner

何を解決するか

garak は、大規模言語モデル(LLM)のセキュリティ上の弱点や障害モードを特定するための脆弱性スキャナです。開発者や研究者が、モデルが望ましくない出力を生成する(幻覚、データ漏洩、毒性、誤情報など)ように操作されないかを、モデルを本番環境に導入する前に検出するのを支援します。

動作方法

このツールは、静的・動的・適応的技術の組み合わせを使用してLLMを攻撃するレッドチームキットとして動作します。モジュールアーキテクチャにより構成されており、以下の要素から成ります:

  • プローブ:特定の相互作用や攻撃ベクトルを生成するモジュール(例:プロンプトインジェクション、DANのようなジャイルブレイク、エンコーディングベースの攻撃)。
  • ジェネレーター:ターゲットのLLMに接続するプラグインで、Hugging Face、OpenAI、AWS Bedrock、RESTエンドポイントなど、幅広いインターフェースをサポートします。
  • 検出器:モデルの応答を分析し、プローブが失敗を引き起こしたかどうかを判断するモジュール。
  • ハーネス:テストプロセスを構造化し、プローブと検出器間のフローを管理するシステム。

対象ユーザー

AIセキュリティ研究者、レッドチームメンバー、LLM開発者向けです。既知の脆弱性や安全性リスクを自動スキャンするプロセスが必要な方々に最適です。

特徴

  • 広範なモデル対応:Hugging Face、OpenAI、Replicate、Groq、AWS Bedrock、GGUFなどのローカルフォーマットを含む、多数のモデルに対応。
  • 豊富なプローブライブラリ:プロンプトインジェクション、マルウェア生成、XSS、および「グリッチトークン」専用のプローブを含む。
  • 自動評価:明確な失敗率と、各プロービング試行ごとの詳細なJSONLログを提供。
  • 拡張性の高い設計:ユーザーが簡単に独自のプローブ、検出器、ジェネレーターを作成・統合できるように設計されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch