Anthropic、AIシステムのレッドチーミングにおける課題とベストプラクティスを概説

TL;DR

Anthropicは、AIモデルを評価するために使用するレッドチーミング手法の包括的な概要を公開しました。各手法が安全性においてなぜ重要なのか、どのような実用的な利点と障害があるのか、そして政策立案者が業界全体の標準を策定するためにどのように貢献できるかを説明しています。


レッドチーミングとは何か、そしてなぜ標準が必要なのか

レッドチーミングとは、AIシステムが展開される前に脆弱性を明らかにする敵対的テストプロセスです。現在、開発者は多種多様な手法を採用しており、多くの場合、実装方法も異なっています。そのため、この分野には安全性の結果を比較するための共通のフレームワークが欠けてています。Anthropicは、今すぐ共通の慣行を確立することが、組織が現在のリスクを管理し、将来のより有能なモデルに備えるのに役立つと主張しています。


ドメイン特化型の専門家によるレッドチーミング

政策の脆弱性テスト(信頼と安全)

目的: 子どもの安全、選挙の完全性、過激化などの高リスクな危害に関する、定性的で詳細なテスト。 アプローチ: 外部のNGO(例:Thorn、Institute for Strategic Dialogue、Global Project Against Hate and Extremism)と提携し、Anthropic Usage Policyに照らしてモデルを調査する。 利点: 複雑で文脈依存的な脅威に関する専門知識を活用できる。 課題: 外部専門家との調整に時間がかかる場合があり、結果は定性的であることが多く、定量化が困難である。

フロンティア脅威のレッドチーミング(国家安全保障)

目的: 化学、生物、放射性、核(CBRN)、サイバーセキュリティ、および自律型AIシナリオに焦点を当て、国家安全保障に影響を与える可能性のあるリスクを評価する。 アプローチ: ドメインエキスパートと協力し、時にはリスク軽減策が変更された非商用モデルバージョンを使用する。 利点: 影響の大きい重大な脅威モデルに直接対処する。 課題: 機密性の高い専門知識へのアクセスが必要であり、カスタムのモデル構成が必要になる場合がある。

多言語・多文化レッドチーミング

目的: ほとんどのテストにおける英語中心のバイアスを軽減するため、他の言語や文化的文脈でモデルを評価する。 アプローチ: シンガポールのInfocomm Media Development Authority (IMDA) および AI Verify Foundation と提携し、英語、タミル語、中国語、マレー語で、地域に関連するトピックについてテストを行う。 利点: 表象の多様性を向上させ、言語特有の失敗モードを明らかにする。 課題: 資格のある現地のテスターの確保が限られており、文化的にニュアンスのある評価基準が必要となる。


言語モデルを使用したレッドチーミング

自動レッドチーミング

目的: モデルに攻撃(レッドチーム)を生成させ、別のモデルをファインチューニング(ブルーチーム)のデータとして使用することで、敵対的テストをスケールさせる。 利点: 数千ものテストケースを迅速に生成でき、新しい攻撃ベクターの発見を加速させる。 課題: 自動化された攻撃は、人間中心の微妙な危害を逃す可能性があり、明確な評価指標がない場合、レッドチーム/ブルーチームのループがいたちごっこになる可能性がある。


新しいモダリティのレッドチーミング

Claude 3 のマルチモーダル・レッドチーミング

目的: Claude 3 の画像入力機能(写真、スケッチ、チャートを分析できるが、画像は生成しない)をテストする。 アプローチ: 内部の Trust & Safety チームおよび外部パートナーが、有害な視覚的およびテキストによる入力に対する拒否行動を評価する。 利点: 画像ベースの詐欺、子どもの安全違反、過激主義的なコンテンツなどの新しいリスクを識別する展開前に。 課題: マルチモーダル評価には、純粋なテキストテストとは異なる、新しいツールや専門知識が必要となる。


オープンエンドな、汎用的なレッドチーミング

クラウドソースによるレッドチーミング

目的: 特定の脅威カテゴリを規定せずに、管理されたクラウドワーカーのプールから多様な攻撃アイデアを集める。 利点: 幅広いスペクトラムの危害を捉え、現実世界のユーザーの判断を反映する。 課題: 研究設定に限定されており、攻撃の品質と一貫性はワーカーの専門知識に依存する。

コミュニティ・レッドチーミング(例:DEF CON AI Village, GRT Challenge)

目的: 非技術的な参加者を含む幅広い層を対象に、公開されたモデルをテストする。 参加者: 幅広いオーディエンスを、公開されたモデルをテストするために巻き込む。 利点: メディアの創造性を促進し、参加の幅を広げ、予期せぬ失敗モードを表面化させる。 課題: 管理、データのプライバシー、再現性の確保を、大規模で多様な参加者ベース全体でどのように行うか。


定性的レッドチーミングから定量的評価へ

Anthropicは、反復的なパイプラインを説明しています:

  1. 定性的調査 – 専門家が脅威モデルを定義し、アドホックな攻撃を攻撃を行う。
  2. 標準化 – レッドチーマーが、有害な行動をより確実に引き出すために入力を洗練させる。
  3. 自動化 – 言語モデルが、成功した攻撃のバプローチを大規模にバリエーションとして生成する。
  4. 評価 – 自動化されたスイートが、モデルのファインチューニングにフィードバックされる定量的な指標を提供する。 このワークフローは、すでにフロンティア脅威や選挙の完全性に関するテストに適用されており、さらなる脅威モデルへの適用が意図されています。

堅牢なレッドチーミング・エコシステムを促進するための政策提言言

  1. 標準開発の資金提供 – NIST のような機関に、安全な AI レッドチーミングのための技術的なガイドラインを作成するための支援を行う。
  2. 独立したテスト機関の支援 – ドメイン特化型のリスク評価において、開発者と提携できる政府や非営利組織に資金を提供。
  3. プロフェッショナルなレッドチーミング市場の創設 – 共通の技術的標準を満たす企業に対して、認証制度を導入する。
  4. 第三者アクセスの義務化 – AI 企業に対し、検証済みの外部グループが安全な条件下でレッドチーミングを実施することを許可することを要求する。
  5. レッドチーミングをスケーリング・ポリシーと結びつける – より大きなモデルのリリース-能力を、実証可能なレッドチーミングの結果と責任あるスケーリングへのコミットメントに結びつける。

結論

Anthropic の分析によれば、AI 安全性のすべての課題に対して、単一のレッドチーミング手法が十分であることはありません。ドメインエキスパート、自動化、マルチモーダル、コミュニティ・アプローチを組み合わせ、定性的インサイトを、定量的指標へと移行させることで、再現可能でスケーラブルな安全性テストの検討の道が開けます。政策立案者や業界のステークホルダーホルダーは、標準の資金提供、独立したテスターの支援、認証制度や透明性の要件を制度化することで、この進展を加速させることができます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch