Anthropicがモデルの安全性に関するバグバウンティプログラムを拡大

TL;DR

Anthropicは、次世代のAI安全性緩和策に対するユニバーサルなジェイルブレイク攻撃の発見に対し、最大15,000ドルを報酬として提供する、招待制の拡大されたバグバウンティプログラムを発表しました。これは、CBRNやサイバーセキュリティなどの高リスクな領域を保護することを目的としています。

プログラムの概要

Anthropicは、多くのトピックにわたってAIの安全性ガードレールを一貫して回避する攻撃、すなわちユニバーサルなジェイルブレイク攻撃に焦点を当てた、新しいバグバウンティ・イニシアチブを開始します。このプログラムは、化学、生物、放射性、および核(CBRN)の脅威やサイバーセキュリティといった、重要かつ高リスクな領域に影響を与える可能性のある脆弱性を対象としています。

イニシアチブの仕組み

  • Early Access: 選ばれた参加者は、Anthropicの最新の安全性緩和システムへのプレリリース・アクセス権を受け取り、管理された環境で弱点のテストを行うことができます。
  • Scope and Rewards: 高リスクな領域を侵害する可能性のある、新しいユニバーサルなジェイルブレイクに対して、最大15,000ドルのバウンティが提供されます。ジェイルブレイクが「ユニバーサル」であると見なされるのは、トピックを問わず、定義された一連の有害な質問に対してモデルが回答できるようにする場合です。
  • Evaluation Process: 参加者には詳細な指示とフィードバックが提供されます。提出された内容は、新規性と影響力の観点から評価され、招待制フェーズでは、タイムリーで建設的なフィードバックが約束されています。

参加資格と申請方法

初期フェーズは招待制であり、HackerOneとのパートナーシップにより運営されます。AIセキュリティや言語モデルのジェイルブレイクにおいて実績のある経験を持つ研究者は、**August 16(金)**までにapplication formから申請できます。選ばれた申請者は、秋に連絡を受け、参加が案内されます。

継続的な報告メカニズム

Anthropicは、現在デプロイされているモデルの安全性に関する問題の報告を継続的に受け付けています。研究者は、詳細な調査結果を usersafety@anthropic.com へメールで送ることができます。同社は、ガイダンスとしてResponsible Disclosure Policyを参照しています。

グローバルなAI安全性へのコミットメントとの整合性

このバウンティプログラムは、ホワイトハウスの Voluntary AI Commitments およびG7の Code of Conduct for Organizations Developing Advanced AI Systems に基づくAnthropicのコミットメントを支援するものです。ユニバーサルなジェイルブレイクの緩和に焦点を当てることで、Anthropicは、急速に進歩するAI能力と歩調を合わせて、安全策が進化することを確実にすることを目指しています。

関連する発表

  • Improving Fable 5's biology safeguards – ドメイン固有の安全性強化に関する詳細は、リンクされた発表を参照してください。
  • Mariano-Florentino (Tino) Cuéllar joins Anthropic as Chief Global Affairs Officer – 同社のグローバルな政策関与に関連するリーダーシップの更新情報です。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch