Anthropic ASL-3 安全防御のためのバグバウンティプログラム

Anthropicは、化学、生物、放射性、および核(CBRN)兵器へのAIの悪用を防ぐために設計された安全分類器(safety classifiers)のストレス・テストを行うため、バグバウンティプログラムを開始しました。この取り組みは、Anthropicの責任あるスケーリング・ポリシー(Responsible Scaling Policy)で定義されている、AI Safety Level-3(ASL-3)デプロイメント基準を満たすためのAnthropicの取り組みの一環です。

憲法分類器(Constitutional Classifiers)のストレス・テスト

Anthropicは、HackerOneとのパートナーシップにより管理されるバグバウンティプログラムを利用して、更新されたConstitutional Classifiersシステムのテストを行っています。Constitutional Classifiersは、特定の危害に基づいて許可されるコンテンツと許可されないコンテンツを定義する一連の原則に従うことで、CBRN兵器に関連する情報を引き出す可能性のあるジェイルブレイク(jailbreaks)を防ぐように設計されています。

プログラムの初期フェーズでは、参加者はClaude 3.7 Sonnet上でこれらの分類器をテストするための早期アクセス権が付与されました。プログラムでは、検証済みのユニバーサル・ジェイルブレイク(複数のトピックにわたって一貫して安全策を回避する脆弱性)、特にCBRN関連のトピックでの悪用を可能にするものに対して、最大25,000ドルの報酬が提供されました。

責任あるスケーリング・ポリシー(RSP)との整合性

このバグバウンティプログラムは、Anthropicがますます有能なモデルをどのように開発し、デプロイするかを規定する責任あるスケーリング・ポリシー(RSP)フレームワークの直接的な適用です。同社は、モデルがより有能になるにつれて、ASL-3基準で概説されている高度なセキュリティおよび安全保護策が必要になる可能性があると述べています。この取り組みは、ASL-3のセーフガードを公開前に反復的にテストし、ストレス・テストするための手法として機能します。

プログラムの進化と拡大

2025年5月18日に初期プログラムが終了した後、Anthropicは2025年5月22日にアップデートを発表し、取り組みを新しいフェーズへと移行させました。この新しい招待制プログラムは、以下に焦点を当てています:

  • Claude Opus 4 Testing: Claude Opus 4モデル上でConstitutional Classifiersシステムをストレス・テストすること。
  • General Safety Systems: 現在開発中の他の安全システムをテストすること。
  • Public Report Collection: Anthropicは現在、ソーシャルメディアなどの公開プラットフォームやフォーラムで見つかった、ASL-3の懸念される用途(特に生物学的脅威に関連する情報を引き出すもの)に対するユニバーサル・ジェイルブレイクの報告を受け付けています。

参加要件

バグバウンティプログラムへの参加は、タイムリーなフィードバックと対応を確実にするため、招待制となっています。Anthropicは、言語モデルのジェイルブレイクを特定する実証済みの専門知識を持つ、経験豊富なレッドチーム(red teamers)や研究者に対し、招待の申請を推奨しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch