Anthropic Election Safeguards Update

Anthropicは、2026年の米国中間選挙およびその他の世界的な選挙において、Claudeが正確、公平、かつバランスの取れた情報を提供できるように、Claudeのための更新された選挙セーフガードを導入しました。これらの措置は、憲法的なトレーニング、厳格な評価ベンチマーク、およびリアルタイムのリソース統合を組み合わせることで、政治的バイアスと悪用を防ぎます。

Preventing Political Bias through Neutrality Training

Claudeは、特定の視点にユーザーを誘導することを防ぐため、多様な政治的見解に対して同等の深さと分析的な厳密さを持って扱うようにトレーニングされています。この中立性は、主に2つのメカニズムを通じて達成されます:

  • Character Training: Claudeの憲法で定義された一連の価値観と特性に沿った回答を生成することに対して、モデルに報酬が与えられます。
  • System Prompts: Claude.ai上のすべての会話に、政治的中立性に関する明示的な指示が統合されています。

これらのセーフガードを検証するために、Anthropicは各モデルのリリース前に評価を実施しています。最近のテストでは、**Opus 4.7は95%、Sonnet 4.6は96%**のスコアを記録し、政治的スペクトラム全体にわたるプロンプトに対して公平に関与する能力を示しました。Anthropicは、外部による再現を可能にするために、評価手法とデータセットをオープンソース化しています。

さらに、同社は、表現の自由に関するモデルの挙動をレビューするために、The Future of Free Speech、the Foundation for American Innovation、および the Collective Intelligence Projectを含む外部組織と協力しています。

Policy Enforcement and Risk Mitigation

AnthropicのUsage Policyは、Claudeを欺瞞的な政治キャンペーン、言論を左右するための偽のデジタルコンテンツの作成、有権者不正、投票システムの妨害、または投票プロセスに関する誤解をさせる情報を拡散することに使用することを禁止しています。

Detection and Defense Mechanisms

これらのポリシーを遵守させるために、Anthropicは多層的な防御戦略を採用しています:

  • Automated Classifiers: これらのツールは、潜在的なポリシー違反をリアルタイムで検出します。
  • Threat Intelligence Team: 専任のチームが、組織的な悪用への取り組みを調査し、阻止します。

Performance Benchmarks

Anthropicは、600個のプロンプト(有害なもの300個と正当なもの300個)を使用して、ClaudeのUsage Policyへの遵守状況をテストしました。その結果、Claude Opus 4.7は100%の回数で適切に回答し、Claude Sonnet 4.6は99.8%の回数で適切に回答しました

世論を操作するための組織的な取り組みである影響力行使(influence operations)に関しては、シミュレーションされたマルチターン会話において、Sonnet 4.6とOpus 4.7はそれぞれ90%と94%の回数で適切に回答しました

Autonomous Influence Operations

Anthropicは、初めてモデルが自律的に多段階の影響力行使キャンペーンを計画し、実行できるかどうかをテストしました。セーフガードとトレーニングにより、最新のモデルはほぼすべてのタスクを拒否しましたが、セーフガードなしでのテストでは、Mythos PreviewとOpus 4.7はタスクの半分以上を完了しました。これは、多大な人間による指示が必要であるものの、継続的な警戒が必要であることを示しています。

Integration of Reliable Election Resources

ユーザーが事実に基づいた情報を受け取れるように、Claudeは選挙バナーを通じて、信頼できる非党派的なソースへの直接リンクを統合しています。

  • US Midterms: 投票者登録、投票場所、または投票用紙情報について尋ねるユーザーは、Democracy WorksによるリソースであるTurboVoteに誘導されます。
  • Global Expansion: 同様のバナーシステムが、今年後半のブラジル選挙に向けて計画されており、さらにグローバルな展開が続く予定です。

Ensuring Up-to-Date Information via Web Search

LLMは固定された知識のカットオフ(知識の期限)があるため、Anthropicは候補者の発表や選挙結果に関する最新情報を提供するために、ウェブ検索を使用します。2026年の米国中間選挙に関連する600以上のプロンプトを使用した評価において、Opus 4.7とSonnet 4.6はそれぞれ92%と95%の回数でウェブ検索をトリガーし、ユーザーを最新のデータに誘導することを確実にしています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch