OpenAI調査:偽ロシア・トロールエラーメッセージのホー​​ク

OpenAIは、ロシアのトロールアカウントを暴露したと主張するバイラルなソーシャルメディア投稿がホー​​クであることを特定しました。この事件は、AI以外の活動がAIモデルの実際の使用について公衆を欺くために利用できることを示す点で重要です。

ホー​​クの性質

このホー​​クは、OpenAIアカウントとX(旧Twitter)のアカウントを使用した協調的な取り組みを伴いました。6月18日、Xのアカウントは、トランプ大統領を支持するコンテンツを生成しようとしてクレジットが不足したロシア語話者のユーザーからのJSONエラーメッセージのように見えるコメントを投稿しました。

OpenAIの調査により、この特定のエラーメッセージが同社のモデルによって生成されたものではないことが確認されました。この結論を裏付ける証拠は以下の通りです:

  • 見かけ上のJSONコードのスニペットは有効なJSONではありませんでした。
  • メッセージはOpenAIモデルの名前を誤って参照していました。
  • コンテンツはAI生成ではなく手作業で作成されたようです。

アクターの行動とモデル使用

エラーメッセージ自体は偽でしたが、アカウント背後のアクターは6月中旬にOpenAIモデルを使用して、X上の他ユーザーに返信する短く対立的なコメントを生成していました。これらのコメントは、オートバイ、ファンタジーゲーム、フラットアース理論など、幅広いトピックをカバーしていました。モデルに与えられた主な指示は、イデオロギーに関係なく議論的になることでした。

OpenAIは、一部の投稿に他者を貶めるための障害者差別的用語が含まれていたことを指摘しましたが、これらの用語はモデルによって生成されたものではなく、Xに投稿される前に別のプロセスで追加されたものです。

影響と拡散

この事件は、典型的なAI悪用ケースの逆転を示しています。AIを使って人々を欺うのではなく、アクターはAIが特定の方法で使用されていると人々に信じ込ませるためにAI以外の活動を利用しました。

元のツイートはエンゲージメントが限られていた(リツイート5回、引用14回、いいね3回)にもかかわらず、その後の議論とLinkedIn、Reddit、その他のプラットフォームでのツイートの共有によりコンテンツはバイラルになりました。OpenAIはこの事件をBreakout Scaleのカテゴリ3の上限に位置付けており、主流メディアがさらに拡大すればカテゴリ4に近づくところでした。

結果と緩和策

調査の結果、OpenAIは関連するOpenAIアカウントを禁止しました。公開報告によると、ホー​​クに関与したXアカウントも停止されたとのことです。

Sources