マルウェア作成者がLLMのセーフティガードレールを利用してAIセキュリティスキャナーを回避する

マルウェア開発者は、大規模言語モデル(LLM)のセーフティ拒否を誘発するために、核兵器や生物兵器に関連するテキストをスパイウェアに埋め込むようになっています。この手法は、AIセキュリティスキャナーの強力なガードレールを悪用するものであり、モデルにコードの解析を拒否させることで、悪意のあるソフトウェアが自動検出を回避することを可能にします。

LLMのセーフティガードレールを攻撃ベクトルとして利用する

AIモデルにおける強力なセーフティ拒否は、攻撃者が武器化できる二次的なブラインドスポット(死角)を生み出します。LLMを搭載したセキュリティスキャナーが、生物兵器や核兵器の指示や言及といった禁止されたコンテンツに遭遇した場合、モデルは特定の禁止テキストをフィルタリングするのではなく、リクエスト全体を完全に拒否するようにプログラムされています。この「フェイルオープン(fail-open)」の脆弱性により、スキャナーのパイプラインが拒否を悪意のシグナルとして扱うように設計されていない場合、マルウェアは解析されないまま残ることになります。

AI搭載セキュリティパイプラインへの影響

この戦術の出現は、プロンプト操作を防ぐために、マルウェア解析パイプラインにおける意図的な設計の必要性を浮き彫りにしています。セキュリティの専門家や開発者は、いくつかの重要な検討事項を指摘しています。

拒否を悪意のシグナルとして扱う

一部の専門家は、AI支援スキャナーがセーフティガードレールに抵触した場合、そのコードを自動的に悪意のあるものとしてフラグを立てるべきだと主張しています。正当なソフトウェアが核兵器の製造に関する言及を含むことは稀であるため、LLMからの拒否は、何らかの邪悪な事象が発生していることを示す明確なシグナルとなります。

「フェイルオープン」設計のリスク

自動化されたパイプラインが「フェイルオープン」に設定されているリスクがあります。つまり、AIがファイルの解析に失敗した場合、そのまま通過させてしまうことを意味します。ある寄稿者は、このアプローチがすでに特定の環境において悪意のあるコードを通過させることに成功していると指摘しています。

多段階解析パイプライン

これらのブラインドスポットを軽減するために、一部では階層的な解析アプローチが提案されています。これは、まず安価なオープンソースモデルを使用して、LLMの拒否を誘発する可能性のあるコンテンツを事前にフラグ立てし、その後に、より深いセキュリティチェックを行うために、より制限の厳しい主要なLLMにコードを渡すという手法です。

AIガードレールに関するコミュニティの議論

この回避手法の発見は、厳格なAIガードレールの有効性と必要性に関する、より広範な議論を巻き起こしています。

ガードレールの有用性

一部の批判者は、強力すぎるガードレールは正当な技術的な作業をしばしば妨げ、攻撃者に予測可能なブラインドスポットを提供することで、より大きな危険を生み出すと主張しています。彼らは、これらの制限を解除することで、複雑で潜在的に悪意のあるデータを扱う必要があるサイバーセキュリティの専門家にとって、モデルがより有用になると示唆しています。

核・生物兵器に関する制限の可能性

他のコミュニティメンバーは、核兵器や生物兵器に関する情報の制限に価値があるのか疑問を視呈しています。そのような情報は、すでに従来の検索エンジンや歴史的な文献を通じて入手可能であることが多いと指摘しています。

"開発方法を知ることは閉ざされた秘密ではないが、秘密裏に入手することは、世界中が知っている状態でない限り不可能である。"

技術的リスクの要約

リスク メカニズム 影響
プロンプト操作 拒否を誘発するために禁止されたキーワードを埋め込む AIベースの静的解析を回避する
二次的なブラインドスポット 第一次のセーフティに対する過剰なインデックス化 セキュリティのカバー範囲に予測可能なギャップを生み出す
解析の失敗 入力処理に対するLLMの拒否 自動化されたパイプラインにおける「フェイルオープン」シナリオを招く

Sources