OpenAIが隠密AI影響作戦を阻止

OpenAIは、AIモデルを利用して世論を操作し政治的結果に影響を与えようとした5つの隠密影響作戦(IO)を阻止した。生成AIの使用にもかかわらず、これらのキャンペーンはいずれもオーディエンスエンゲージメントやリーチの有意な増加を達成せず、すべてがBrookings Breakout Scaleで2以下のスコアにとどまった。

5つの隠密影響作戦の阻止

OpenAIは、政治コメントの生成、記事の翻訳、オープンソース調査、コードのデバッグなどのタスクにAIを使用した5つの異なる脅威アクターに関連するアカウントを特定し、終了した。

特定された脅威アクター

  • Bad Grammar (Russia): ウクライナ、モルドバ、バルト三国、米国を標的とした、これまで報告されていなかった作戦。アクターはAIを使用してTelegramボットのコードをデバッグし、ロシア語と英語で短い政治コメントを生成した。
  • Doppelganger (Russia): この作戦はAIを使用して、X と 9GAG 用に英語、フランス語、ドイツ語、イタリア語、ポーランド語でコメントを生成し、記事の翻訳・編集、ニュース記事をFacebook投稿に変換した。
  • Spamouflage (China): このネットワークはAIを使用して、公開されたソーシャルメディア活動を調査し、ウェブサイト管理用コード(revealscum[.]com を含む)をデバッグし、X、Medium、Blogspot 用に中国語、英語、日本語、韓国語でテキストを生成した。
  • International Union of Virtual Media (IUVM, Iran): この作戦はAIを使用して、サイト iuvmpress[.]co 用の長文記事、見出し、ウェブサイトタグを生成・翻訳した。
  • Zero Zeno (Israel): 商業会社 STOIC と関連付けられたこの作戦は、AIを使用してInstagram、Facebook、X、関連ウェブサイトに投稿される記事やコメントを生成した。

これらのアクターが生成したコンテンツは、ウクライナ侵攻、ガザ紛争、インド選挙、中国政府への批判など、世界的な地政学的課題に焦点を当てていた。

攻撃者のAI使用トレンド

これらの作戦に関する調査は、AIが人間のオペレーターを置き換えるのではなく、生産性向上のために使用されていることを示している。主なトレンドは以下の通り:

  • 増加した量と品質: AIにより、アクターはテキストや画像をより大量に、かつ人間のオペレーター単独で達成できるより少ない言語エラーで生成できた。
  • ハイブリッドコンテンツ戦略: AIは排他的に使用されたわけではなく、手書きテキストやコピーされたミームなどの従来の形式と組み合わせて使用された。
  • シミュレートされたエンゲージメント: 一部のネットワークはAIを使用して自分の投稿に返信を生成し、偽のエンゲージメントを演出したが、これにより実際のオーディエンス増加は得られなかった。
  • 運用生産性: AIは、ソーシャルメディア投稿の要約やコードのデバッグなど、コンテンツ以外のタスクにも活用された。

防御的トレンドと緩和策

OpenAIは、隠密影響作戦の影響を緩和し、検出速度を向上させるために、いくつかの防御戦略を採用している。

安全システムと設計

OpenAIはモデル設計に安全システムを組み込み、脅威アクターに対して摩擦を生じさせている。その結果、モデルが要求された欺瞞的コンテンツの生成を拒否する事例が複数発生した。

AI駆動調査

内部のAI駆動ツールを使用することで、OpenAIは調査に要する時間を数週間または数か月から数日へと短縮した。これらのツールは検出と分析に使用され、GPT-4がコンテンツモデレーションに使用されるのと同様である。

配布と人的エラー

AI生成物はオーディエンスに届くためにサードパーティプラットフォームを通じて配布される必要があるため、配布段階は攻撃者にとって依然として重要な失敗点である。さらに、OpenAIは脅威アクターが人的エラーを起こしやすく、モデルの拒否メッセージを誤って公開ウェブサイトやソーシャルメディアプロフィールに掲載してしまうことがあると指摘した。

業界協力

OpenAIは業界の仲間と詳細な脅威指標を共有し、広範なコミュニティからのオープンソース研究に依存して、これらの作戦をより効果的に特定・阻止している。

Sources