Anthropic、児童安全原則イニシアチブを発表

TL;DR

Anthropicは、ThornおよびAll Tech Is Humanが主導する連合に参加し、AI生成児童性的虐待コンテンツ(AIG-CSAM)の作成および配布を阻止するための、具体的な開発、展開、およびメンテナンスのアクションを概説する、明示的な児童安全へのコミットメントを採用しました。

コミットメントの概要

Anthropicは、生成AIモデルのライフサイクル全体にわたって、強力な児童安全対策を実施することを公に約束しました。この誓約は、AIシステムが児童性的虐待コンテンツ(CSAM)や関連する危害を生成または拡散するために使用されるリスクを軽減するための、より広範な業界の取り組みと一致しています。

ポリシーの基盤

  • Anthropicの利用規約(Acceptable Use Policy)は、児童の性的搾取または虐待を記述、奨励、支持、または配布するあらゆるコンテンツを厳格に禁止しています。
  • 検知された違反は、**National Center for Missing & Exploited Children (NCMEC)**に報告されます。
  • Anthropicのモデルは画像を読み込むことができますが、現在はマルチモーダルな出力を生成しません。これにより、特定の虐待ベクトルが制限されます。

Safety-by-Design 原則

Anthropicは、Thornによって公開されたSafety by Designフレームワークを採用することを約束しました。このフレームワークは、開発(Develop)、展開(Deploy)、およびメンテナンス(Maintain)の3つのフェーズにおける実行可能な緩和策を定義しています。

開発フェーズ (Develop Phase)

  • 責任あるデータソーシング: CSAMまたは児童性的搾取コンテンツ(CSEM)を含む可能性が高いと専門家によって特定されたデータでのトレーニングを避けます。
  • 取り込みのセーフガード: トレーニングデータ内で発見されたCSAM/CSEMが使用される前に、それを検知、削除、および報告します。
  • レッドチーム・テスト: AIG-CSAMおよびCSEMの生成を対象とした、構造化され、スケーラブルなストレス・テストを実施します。
  • ポリシーの定義: 明示的なトレーニングデータおよびモデル開発ポリシーを確立します。
  • 顧客の制限: 顧客がAnthropicのモデルを使用して、子供に対する性的危害を助長することを禁止します。

展開フェーズ (Deploy Phase)

  • コンテンツ検知: 入力と出力の両方において、虐待的なコンテンツ(CSAM, AIG-CSAM, CSEM)を特定します。
  • ユーザー報告メカニズム: ユーザーが不審なコンテンツをフラグ立てしたり、報告したりするためのオプションを提供します。
  • 執行力: ポリシー違反を強制するためのメカニズムを実装します。
  • 防止メッセージング: CSAMの勧誘を抑止するための警告とガイダンスを展開します。
  • 段階的なロールアウト: 広範なリリース前の、展開の初期段階における虐待の監視を行います。
  • モデルカード: モデルのドキュメントに専用の児童安全セクションを追加します。

メンテナンスフェーズ (Maintain Phase)

  • NCMECへの報告: 報告を提出する際は、Generative AI File Annotationを使用します。
  • 継続的な検知と削除: CSAM, AIG-CSAM, およびCSEMを継続的に特定、報告、および排除します。
  • ツールへの投資: AI生成による操作からコンテンツを保護するためのツールを構築します。
  • 緩和策の品質: 安全対策の効果を定期的に評価し、改善します。
  • 欺瞞の禁止: 子供を性的的に傷つける目的で、生成AIを他者を欺くために使用することを禁止します。
  • OSINTモニタリング: Anthropicのプラットフォームがどのように悪用される可能性があるかを追跡するために、オープンソース・インテリジェンスを活用します。

参考資料

Safety by Design原則の完全なセットと詳細な緩和策は、ホワイトペーパー**“Safety by Design for Generative AI: Preventing Child Sexual Abuse”** (Thorn) に記載されています。この論文は、以下のURLから入手可能です: https://info.thorn.org/hubfs/thorn-safety-by-design-for-generative-AI.pdf.

関連するAnthropicの発表

  • Improving Fable 5's biology safeguards – Fable 5モデルシリーズに対するさらなる技術的セーフガード。
  • Mariano-Florentino (Tino) Cuéllar appointed Chief Global Affairs Officer – グローバルなポリシー・イニシアチブをサポートするためのリーダーシップの拡大。

これらの関連投稿は、AnthropicのAI製品ポートフォリオ全体における安全性とガバナンスへの広範な注力を示しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch