whitzard-ai/jade-db

"他山之石、可以攻玉":复旦JADE团队发布的大模型测评与治理系列

何を解決するか

JADEは、大規模言語モデル(LLMs)の安全ガードレールの評価という課題に対処します。標準的な安全テストではモデルの安全フィルターを回避できない「低トリガーレート」の問題を、ターゲット化された高リスクテストデータセットを生成することで解決します。これにより、モデルの整合性における脆弱性を効果的に探査できます。

動作方法

このプラットフォームは言語的変異(linguistic mutation)を用いて、低トリガーレートの「シード質問」を自動的に高リスクの質問に変換します。これらの変異により、自然な響きを持つテキストが生成され、安全フィルターを回避しやすくなります。生成されたデータセットは、コア価値、違法行為、権利侵害、差別/バイアスの4つの主要カテゴリをカバーし、30以上のサブカテゴリを含みます。

対象ユーザー

AI研究者、開発者、および安全監査担当者向けに設計されており、LLM、マルチモーダルモデル、AIエージェントの安全性の整合性を厳密にテストし、有害または違法なコンテンツを生成しないことを確認する必要があります。

主な特徴

  • 言語的変異: 単純なシードから自動的に高リスクプロンプトを生成し、モデルの堅牢性をより良くテスト可能にします。
  • 包括的なカバレッジ: 中国語および英語モデル向けのデータセットを、違法行為、プライバシー侵害、バイアスなどさまざまな安全領域にわたって提供します。
  • マルチバージョンベンチマーク: Easy、Medium、High-risk(モデル間移行可能)の異なる難易度レベルを提供します。
  • 拡張エコシステム: 電話エージェント用(Jade-BadPhoneAgent)、マルチモーダル幻覚用(Jade-HAL)、推論チェーンの安全性用(Jade-LRMGuard)の専用ツールを含みます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch