Anthropic Election Integrity Testing and Mitigation Framework
Anthropicは、AIモデルにおける選挙関連のリスクを特定し、軽減するための、柔軟で反復的なプロセスを開発しました。専門家による詳細なテストと大規模な自動評価を組み合わせることで、、会社は不正確な選挙情報の拡散を防ぎ、ディスインフォメーション・キャンペーンのようなポリシー違反活動へのモデルの使用を阻止することを目指しています。
A Multi-Layered Approach to Election Safety
Anthropicは、単一の失敗点が選挙の完全性を損なわないように、層状で重複する介入を利用する、システムの安全性のための「スイスチーズモデル」を採用しています。このプロセスは、ポリシー脆弱性テスト、自動評価、軽減策の実施、および有効性の再テスト、という4つの主要な段階で構成されています。
Policy Vulnerability Testing (PVT)
Policy Vulnerability Testingは、Institute for Strategic Dialogueの研究者を含む外部の専門家とともに実施される、定性的で詳細なテスト段階です。PVTは、主に2つのリスクに焦点を当てています:ユーザーが有害または不正確な情報を受け取ること、およびユーザーがUsage Policyに違反することです。
PVTのプロセスは、以下の3つの段階に従います:
- Planning: 選挙管理、政治的平等、および悪意のあるアクターによる潜在的な悪用などのポリシー領域を選択します。
- Testing: 専門家が非対抗的および対抗的なプロンプトを構築し、モデルの出力を記録してポリシーとのベンチマークを行います。
- Reviewing: 安全システムにおけるギャップを特定し、修正の優先順位を決定するための共同セッションを行います。
Scalable Automated Evaluations
手動テストでは達成できない広範な範囲を提供するために、Anthropicは自動評価を使用します。これらは、専門家が作成したPVTの質問に基づいたfew-shot promptingアプローチを使用して、言語モデルを用いて数百のテスト質問を生成することで開発されます。
自動評価により、以下が可能になります:
- Scalability: 数分間で、複数のモデルバリエーションにわたって数百のプロンプトをテストします。
- Comprehensiveness: 大規模でターゲットを絞った評価セットを通じて、より広い範囲のシナリオを評価します。
- Consistency: 異なるモデル間で一貫した質問セットを適用することで、ばらつきを低減します。
品質を確保するために、Anthropicは生成された質問のサンプルを手動でレビューします。ある事例では、EUの選挙管理に関する700問のセットの中から64問をレビューしたところ、モデルが生成した質問の89%がPVTの成果の関連する拡張であったことが判明しました。
Risk Mitigation Strategies
PVTおよび自動評価からの知見は、いくつかの具体的な技術的およびポリシー上の介入につながります:
- System Prompt Updates: システムプロンプトに、モデルの知識のカットオフ日などのコンテキストを追加することで、ユーザーが提供された情報の鮮度を理解するのを助けます。
- Model Fine-Tuning: 特定のトレーニングデータを使用して、望ましい行動を促します。例えば、Anthropicは、モデルが権威ある情報源へユーザーを誘導するよう「報酬」を設定しました。
- Policy Refinement: Usage Policyを更新し、誤情報の生成、選挙プロセスへの干渉、または特定の政治的候補者や政党の支持を明たに禁止します。
- Enforcement Tooling: Claudeのファインチューニング版を利用してプロンプトと完了を評価し、リアルタイムで評価を行います。これは手動監査と、ポリシーを違反するユーザーのオフボーディングに従って補完されます。
- Direct User Redirection: claude.ai上のポップアップバナーなどのUI要素を実装し、米国のユーザーをTurboVoteへ、EUのユーザーをEuropean Parliamentの指示へとリダイレクトします。
Measuring Efficacy through Case Studies
Anthropicは、介入後の同じプロトコルを再実行することで、軽減策が実際に機能するかどうかを検証するために、そのテストフレームワークを使用します。
Knowledge Cutoff References
モデルが時間に関わる選挙に関するクエリに対して、自身の知識のカットオフ日(2023年8月)を参照するようにするため、Anthropicはシステムプロンプトを更新しました。Claude 2、Claude 3 Opusの研究用バージョン(プロンプトなし)、および公開版Claude 3 Opus(プロンプトあり)を比較した結果、Anthropicは、この優先的な軽減策において47.2%の改善を観察しました。
Referrals to Authoritative Sources
権威ある情報源への誘導の頻度を改善するために、Anthropicはモデルのファインチューニングを行いました。Claude 2(この行動のためのファインチューニングなし)とClaude 3 Opus(ファインチューニング済み)の比較では、適切な場合にモデルが信頼できる情報源へユーザーを誘導する頻度が10.4%向上したことが示されました。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch