Goochbeater/Spiritual-Spell-Red-Teaming

A repo for jailbreaking various LLMs, mainly Claude

何を解決するか

このプロジェクトは、AIモデルのセキュリティテスト(レッドチーム)の必要性に対応し、安全フィルタを回避して制限されたコンテンツを生成できる可能性のある脆弱性を特定することに焦点を当てています。

動作方法

このプロジェクトは、AIモデルの堅牢性をテストするための技術とプロンプトのコレクションを提供します。特に「精神的」または創造的なレッドチーム手法に注力し、複雑なプロンプト工学を用いて、モデルが安全ガイドラインを無視するように操作される方法を発見します。

対象読者

セキュリティ研究者やAI開発者向けです。敵対的攻撃をシミュレートすることで、モデルの安全性と整合性を評価したい人を想定しています。

特徴

  • AIモデル向けのレッドチームとセキュリティ研究に焦点を当てています。
  • 安全フィルタの回避をテストする方法を提供します。
  • 敵対的テストを通じてモデルの堅牢性を向上させることを目指しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch