OpenAI、AIを利用した国家系脅威アクターを撹乱

OpenAIは、悪意あるサイバー活動にAIサービスを利用しようとした5つの国家系脅威アクターのアカウントを停止しました。これらの調査結果は、国家アクターがAIを活用しようとしている一方で、現在のモデルは既存の非AIツールに比べてサイバーセキュリティタスクに対する能力が限定的で、漸進的なものにとどまることを示しています。

国家系アクターの撹乱

OpenAIとMicrosoft Threat Intelligenceは、5つの特定の国家系アクターを特定し、撹乱しました。対象となったアカウントは以下のグループで停止されました:

  • 中国: Charcoal Typhoon と Salmon Typhoon
  • イラン: Crimson Sandstorm
  • 北朝鮮: Emerald Sleet
  • ロシア: Forest Blizzard

これらのアクターは主に、オープンソース情報の検索、翻訳、コードエラーの検出、基本的なコーディングタスクの実行といった基本的なタスクにOpenAIサービスを利用していました。

特定アクターの活動

  • Charcoal Typhoon: 企業やサイバーセキュリティツールの調査、コードのデバッグ、スクリプトの生成、フィッシングキャンペーン用コンテンツの作成に注力していました。
  • Salmon Typhoon: 技術論文の翻訳、情報機関や地域の脅威アクターに関する公開情報の取得、コーディング支援、システム上でプロセスを隠す方法の調査にサービスを利用していました。
  • Crimson Sandstorm: アプリやウェブ開発のスクリプト支援、スピアフィッシング用コンテンツの生成、マルウェア検知回避の調査にプラットフォームを活用していました。
  • Emerald Sleet: アジア太平洋地域の防衛専門家や組織を特定し、公開されている脆弱性を調査、基本的なスクリプト作成、フィッシングコンテンツの草案作成を行っていました。
  • Forest Blizzard: 主にレーダー画像技術や衛星通信プロトコルに関するオープンソース調査を行い、スクリプト支援も行っていました。

サイバーセキュリティタスクにおけるAIの能力

この撹乱から得られた結果は、OpenAIおよび外部専門家が実施した過去のレッドチーム評価と一致しています。これらの評価では、GPT-4は公開されている非AIツールで既に実現可能な範囲を超えて、悪意あるサイバーセキュリティタスクに対しては限定的で漸進的な能力しか提供しないと結論付けられました。

OpenAIの多面的安全戦略

国家系の悪用という進化する脅威に対抗するため、OpenAIは4つの要素からなる安全フレームワークを採用しています:

監視と撹乱

OpenAIは、インテリジェンス・調査、セーフティ、セキュリティ、インテグリティの各専門チームを活用し、洗練された脅威アクターを特定します。これらのチームはOpenAI独自のモデルを用いて敵対的なやり取りを分析し、意図を評価します。検出されたアクターはアカウントの無効化、サービスの停止、またはリソース制限の対象となります。

エコシステム協力

OpenAIは、産業パートナーやステークホルダーと協力し、国家系アクターによるAI利用の検出情報を共有します。この取り組みは、AI技術の安全かつ透明な開発を促進する自主的なコミットメントの一環です。

反復的安全緩和策

実際の悪用データを活用して、安全対策の反復的な開発に反映させます。洗練されたアクターがシステムを悪用しようとする手法を分析することで、広範に拡大し得るパターンを特定し、モデルの安全対策を継続的に進化させることが可能になります。

公開透明性

OpenAIは、必要に応じて検出された悪意ある国家系活動の性質と規模について、一般やステークホルダーに情報提供する方針を維持しています。その目的は、共同防御を促進し、すべてのステークホルダーの認識を高めることです。

Sources