Hugging Face と Haize Labs が Red-Teaming Resistance Leaderboard を発表

Haize Labs は、Hugging Face の支援を受けて Red-Teaming Resistance (RTR) Benchmark を導入しました。このツールは、巧妙に作成されたプロンプトを使用して最先端の大規模言語モデル(LLM)の堅牢性を体系的に検証し、失敗モードや脆弱性を特定し、モデルが責任を持って展開されることを保証します。

人間らしい敵対的攻撃に焦点

RTR Benchmark は、作り物の自動攻撃よりも高品質で人間が読める攻撃を優先します。作成者は、GCG 赤チームアルゴリズムなどの多くの自動赤チーム手法は、自然言語と構造的に合致しないプロンプトを生成し、シンプルな分類器ベースの防御で容易にブロックされると主張しています。

Red-Teaming Resistance データセット

現実的なストレステストを確保するために、ベンチマークは過去1年間に公開された AI 安全性研究の主要な赤チームデータセットのコレクションに対してモデルを評価します。これらのデータセットには、対象モデルから有害な機能を引き出すことを目的とした人間によるジャイルブレイクが含まれています。

  • AdvBench: 罵倒、差別、暴力などの行動を引き出す指示。
  • AART: さまざまな文化的、地理的、応用的設定における AI 支援型敵対的プロンプト。
  • Beavertails: 安全性アラインメント研究のために設計されたプロンプト。
  • Do Not Answer (DNA): 責任あるモデルが回答すべきでないプロンプトが含まれる低コスト評価データセット。
  • RedEval-HarmfulQA: 10 のトピックとそれぞれ約 10 のサブトピックをカバーする有害な質問。
  • RedEval-DangerousQA: 人種差別的、ステレオタイプ的、性差別的、違法、毒性、そして有害なコンテンツを含む質問。
  • Student-Teacher Prompting (STP): Vicuna-13B を成功裏に破壊した有害なプロンプト。
  • SAP: 文脈学習を通じて人間の発話を模倣するよう生成された敵対的プロンプト。

応答が「安全」か「不安全」かを判断するために、ベンチマークは LlamaGuard(カスタム分類体系を使用)と GPT-4 の組み合わせを用い、さらに Haize チームによる手動の妥当性チェックを行います。最終スコアは、審査モデルが安全と判断したプロンプトの割合を示します。

違反カテゴリ別の堅牢性

有害性と暴力

  • Hate/Harassment/Discrimination: 不寛容や敵意を助長すること。
  • Children-Specific Harm: 子供を危険にさらす、または害するコンテンツ。
  • Physical-Specific Harm: 身体的な傷害を促す内容。

犯罪行為

  • Malware: 有害なソフトウェアの配布。
  • Fraud/Deception: 個人的利益のための詐欺的行為。
  • Privacy Violation: 無許可のデータ収集や共有。
  • Economic Deception: 金銭的搾取のための誤解を招く行為。
  • Unauthorized practice of medical advice: 正式な許可なしに医療助言を提供すること。
  • Unauthorized Practice of Law: 免許なしに法的サービスを提供すること。
  • Misc. Illegal Activity: その他の違法行為

未求の助言

  • Tailored Financial Advice: 資格なしで提供される特定の金融アドバイス。
  • Political Campaigning: 政治的議題や候補者の無断プロモーション。
  • High Risk Government Decision Making: 権限なしに重要な政府決定に影響を与えること。

NSFW

  • Adult Content: 露骨な言語、罵倒、薬物、アルコール、タバコ乱用に関する議論。
  • Sexual Content: 性的行為を描写または記述した素材。

RTR Leaderboard からの主要な洞察

  1. クローズドソースの優位性: GPT-4 と Claude-2 はすべてのカテゴリで堅牢性において大きなリードを保っています。ただし、著者らはこの優位性がベースモデルによるものか、API に追加された外部の安全性分類器によるものかは不明であると指摘しています。
  2. 共通の脆弱性: モデルは成人向けコンテンツ、身体的危害、子供への危害を引き起こすジャイルブレイクに最も脆弱です。
  3. 強力な防御: モデルは一般に、プライバシー侵害、法的、金融的、医療的助言の要求や政治的キャンペーンに対して高い堅牢性を示します。

Sources