AI Bot Spoofing とエージェンティック・ウェブの現状

AIツール設定を標的としたAIボットなりすましキャンペーン

現在、ウェブ全体で脆弱性スキャンを大規模に実施するために、AIボットになりすますアクティブな脅威キャンペーンが行われています。Known Agentsのデータによると、攻撃者は ClaudeBot や GPTBot を含む、認識されたAIエージェントのアイデンティティを偽装し、単純なフィルタリングを回避して、AIコーディングツールで使用される特定の認証情報や設定パスを標的にしています。

標的となる脆弱性

このキャンペーンは、機密性の高いAPIキー、環境変数、および設定値が含まれている可能性のあるファイルやディレクトリを具体的に標的にしています。優先度の高いターゲットは以下の通りです:

  • AIツール設定: /.config/anthropic/credentials/default.json, /.claude/settings.json, /.claude.json, /.aider.conf.yml, および /.continue/config.json
  • 環境ファイル: /.env, /.env.local, /.env.production, および /.env.backup
  • クラウド認証情報: /.aws/credentials, /.aws/config, /service-account.json, および /firebase-adminsdk.json
  • インフラストラクチャファイル: /docker-compose.yaml, /terraform.tfstate, および /.docker/config.json

検知と緩和策

User-Agent文字列は容易に偽装できるため、セキュリティの専門家は、User-Agentはアイデンティティの信頼できるプロキシではないことを強調しています。これらの攻撃を緩和するために、管理者は以下の対策を講じるべきです:

  1. 逆引きDNSまたはIPレンジによる検証: 正当なAIクローラーは、通常、自身のIPレンジを公開しているか、逆引きDNS検証をサポートしています。
  2. Web Bot認証の実装: GoogleのWeb Bot Authのような新しい標準は、単純なヘッダーを超えた、より安全なクローラー認証方法の提供を目指しています。
  3. 環境の要塞化: すべての偽装IPをブロックしようとするのではなく、実際のターゲットパスの保護(例:.envファイルがウェブからアクセスできないようにするなど)に重点を置いてください。

"リストされているユーザーエージェントの多くは、しばしば偽装されています。そのIPがどのASNに属しているかを確認してください。ほとんどのVPSプロバイダーをブロックすれば、偽装されたボットの大部分は消えてなくなります。"

エージェンティック・ウェブの現状:トラフィックの傾向

5,000以上のウェブサイトを監視しているAgentic Web Indexのデータは、ウェブへのアクセス方法が大きく変化していることを明らかにしています。「エージェント化(Agentrification)」、つまりボットトラフィックに占めるAI関連の割合は、過去90日間で11%増加し、現在ではボットトラフィック全体の28%を占めています。

AIスクレイピングとデータ収集

AIデータスクレイパー(LLMのトレーニング用にコンテンツをダウンロードするボット)は、AI活動の大部分を占めています。ClaudeBotはこのカテゴリで最も活発であり、AIスクレイピングトラフィックの27%を占めています。次いで meta-externalagent (19.5%)、Amazonbot (19.2%) となっています。

AIフェッチとRAG

AIアシスタントやコーディングエージェントは、リアルタイムの検索拡張生成(RAG)を機能させるために「フェッチ(取得)」を使用します。このトラフィックは ChatGPT-User が支配的であり、AIフェッチ活動全体の86.4%を占めています。これらのボットは、ユーザーにリアルタイムの回答を提供するために、主にリファレンス、科学、金融のカテゴリを標的にしています。

AI検索インデックス作成

AI検索クローラーは、AIを活用した検索結果に引用を提供するためにコンテンツをインデックス化します。PetalBot (25.4%) と Amzn-SearchBot (17.3%) が、現在この分野で最も活発なエージェントです。

robots.txt の遵守と有効性

robots.txt ルールの全体的な有効性は98.5%と高いものの、著名なボットの間には顕著な例外があります。

コンプライアンスのギャップ

特定のボットは有効性スコアが低く、これは disallow ルールによってブロックされた後にトラフィックを削減する可能性が低いことを意味します。注目すべきルール違反者は以下の通りです:

  • Baiduspider: 有効性 82.6%
  • SirdataBot: 有効性 84.5%
  • ShapBot: 有効性 90.4%

最もブロックされているエージェント

ウェブサイト管理者は、AIトレーニングボットを最も積極的にブロックしています。上位1,000のウェブサイトにおいて、GPTBot (24.6%)、CCBot (22.6%)、ClaudeBot (21.7%) が最も頻繁にブロックされているエージェントです。

ボットトラフィックに関するコミュニティの視点

開発者やシステム管理者の間の技術的な議論では、これを新しい脅威と見なす層と、既存の「バックグラウンドノイズ」の進化と見なす層との間で意見が分かれています。

「水は濡れている」という視点

多くの経験豊富な管理者は、大規模な脆弱性スキャンはインターネットの永続的な状態であると主張しています。AIボットのなりすましは、数十年にわたりWordPressのログインページを標的にしてきたものと同じ種類のスキャンのための、新しい隠蔽工作の層に過ぎないという考え方です。

能動的なブロックのリスク

一部の開発者は、攻撃的なボット対策モード(一部のCDNが提供するものなど)は逆効果になる可能性があると警告しています。過剰なブロックは「クロールバジェット」の浪費につながり、GoogleやBingのような正当な検索エンジンが誤ってブロックされ、サイトのSEOや視認性に悪影響を及ぼす可能性があります。

Sources

関連