Anthropic Election Integrity Strategy 2024
Anthropicは、2024年の世界的な選挙サイクルにおけるAIの悪用リスクを軽減するための包括的なフレームワークを導入しました。この戦略は、政治キャンペーンの防止、誤情報の拡散の抑制、およびユーザーがAIによる潜在的なハルシネーション(幻覚)ではなく、権威ある投票情報を受け取れるようにすることに焦点を当てています。
Strict Policies Against Political Campaigning and Lobbying
Anthropicは、その利用規約(AUP)を通じて、政治キャンペーンやロビー活動へのツールの使用を禁止しています。この制限は、特に候補者が自身を装ったチャットボットを作成することを防ぎ、ターゲットを絞った政治キャンペーンへのClaudeの使用を禁止するものです。
これらのポリシーを執行するために、Anthropicは誤情報や影響力行使のオペレーションを特定するための自動検出システムを採用しています。執行措置は、段階的なアプローチに従います:
- Warnings: ユーザーまたは組織に対して、悪用が発見された際に発行されます。
- Suspensions: 極端なケースでは、ツールやサービスへのアクセスが取り消されます。誤検知を最小限に抑えるため、すべての停止措置は人間によるレビューが行われます。
Adversarial Testing and Technical Evaluations
2023年以来、Anthropicは、システムがAUPに違反する方法を特定するために、ターゲットを絞ったレッドチーミングを介して「Policy Vulnerability Testing」を実施してきました。このテストは、主に2つのベクトルに焦点を当てています:
- Misinformation and Bias: 候補者、選挙管理、および政治的問題に関するクエリに対するシステムの応答を分析します。
- Adversarial Abuse: 有権者抑制の戦術を要求するプロンプトに対するシステムの回復力をテストします。
レッドチーミングを補完するものとして、同社は以下の項目を測定するための定量的な社内評価スイートを使用しています:
- Political Parity: さまざまな候補者やトピックにわたってモデルの応答の一貫性を確保します。
- Refusal Rates: システムが有害な選挙関連のクエリへの応答を拒否する度合いを測定します。
- Robustness: 有権者のプロファイリング、ターゲティング戦術、および偽情報の生成を防止する能力をテストします。
Redirecting Users to Authoritative Voting Information
モデルが誤った情報を生成するハルシネーションのリスクに対抗するため、Anthropicは、投票情報を求めるユーザーを、非党派的で権威ある情報源へ積極的にリダイレクトします。モデルはリアルタイムの選挙データを提供するために十分な頻度でトレーニングされていないため、重要な投票に関するクエリに対しては、AIが生成した回答からユーザーを遠ざけるように設計されています。
Regional Implementations
- United States: 米国ベースのユーザーが投票情報を求めた場合、非党派組織Democracy Worksが提供するリソースであるTurboVoteへのリダイレクトを提案するポップアップが表示されます。
- European Union: 2024年5月にClaudeが欧州へ拡大されたことに伴い、EUベースのユーザーに対しても同様のポップアップ介入が実施され、欧州議会の非党派的な選挙ウェブサイトへとリダイレクトされます。
Adaptive Response to Unanticipated AI Use
Anthropicは、AIの導入が予期せぬ影響や予期せぬ使用方法をもたらすことが多いことを認識しています。同社は、システムの新たな、予見できない使用方法をリアルタイムで検出する方法を開発しており、発見された内容は、それが明らかになるにつれてオープンに伝達することを約束しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch