Claudeの悪用に関する検知と対策

Anthropicは、Claudeを使用して影響力工作(influence operations)を指揮し、認証情報のスクレイピングを自動化し、採用詐欺を強化し、マルウェアを開発している複数のアクターを特定し、禁止措置を講じました。この取り組みは、最先端のAIモデルがコンテンツ生成だけでなく、複雑で半自律的な悪用システムのオーケストレーター(指揮役)として利用されるという、新たな傾向を浮き彫りにしています。

Influence-as-a-Service(サービスとしての影響力工作)のオーケストレーション

Anthropicは、FacebookおよびX(旧Twitter)にわたる100以上のソーシャルメディア・ボットアカウントを管理するためにClaudeを使用した、プロフェッショナルな「influence-as-a-service」オペレーションを検知しました。従来のAIの悪用とは異なり、このオペレーションはClaudeをオーケストレーターとして使用し、政治的な動機に基づいたペルソナに従って、特定の投稿に対してボットが「いいね」をするか、シェアするか、コメントするか、あるいは無視するかといった戦術的なエンゲージメントの決定を下すために使用されていました。

オペレーションの詳細

  • Scale: 複数の国や言語にわたる数万の真正なソーシャルメディア・アカウントと関与しました。
  • Tactics: Claudeは、一貫貫した政治的ペルソナの作成と維持、整合性のある回答の生成、および画像生成ツール用のプロンプト作成に使用されました。
  • Objective: このアクターは、バイラル(拡散)状態を目指すのではなく、穏健な政治的視点を促進するために、持続的かつ長期的なエンゲージメントに焦点を当てていました。
  • Attribution: ナラティブ(語り口)は国家が関与するキャンペーンと一致していましたが、Anthropicは特定の帰属(attribution)を確定していません。

AIを活用したサイバー攻撃および詐欺能力

Anthropicは、AIが攻撃の技術的障壁を下げたり、既存の攻撃ベクトルを強化したりするために使用された、3つの異なるケースを特定しました。

認証情報のスクレイピングとIoTアクセス

高度なアクターが、Claudeを使用して、セキュリティカメラに関連する流出したユーザー名とパスワードをスクレイピングするためのツールを開発していました。このアクターは、商用の漏洩データプラットフォームやプライベートなスティーラーログ・コミュニティを統合して、ターゲットを定めます。Claudeは、オープンソースのスクレイピング・ツールキットの書き換え、ターゲットURLの抽出用スクリプトの作成、およびバックエンドの検索機能の改善に使用されました。Anthropicは、これらの機能が実際に展開・使用されたかどうかは確認していません。

採用詐欺と「言語のサニタイズ(浄化)」

東欧諸国の求職者をターゲットにしたオペレーションは、「リアルタイムの言語サニタイズ」にClaudeを使用していました。拙い、非ネイティブな英語のテキストをClaudeに提出し、ネイティブスピーカーのように書き換えるよう依頼することで、アクターは詐欺の信憑性を高めていました。Claudeは、説得力のある採用ナラティブや面接シナリオの開発にも使用されていました。Anthropicは、これらの詐欺の展開・使用が成功したかどうかは確認していません。

検出と緩和のフレームワーク

Anthropicは、標準的な大規模検知を回避する危害を特定するために、多層的なインテリジェンス・プログラムを採用しています。同社は、ユーザーの入力とモデルの応答を評価する分類器(classifiers)と、高度な分析手法の組み合わせを利用しています。

技術的分析手法

大量の会話データを分析し、悪用のパターンを特定するために、Anthropicは自社の研究から得た以下の手法を適用しました:

  • Clio: 悪用のパターンを検知するためのツール。
  • Hierarchical Summarization: 大規模なデータを監視・分析するための手法。

これらの活動を検知した際、Anthropicは関連するアカウントを禁止し、これらのケースから得った学習内容を、将来の検知と防止を向上させるために、より広範なコントロール・セットに統合しました。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch