Anthropicによる知能標的化および従来型兵器開発におけるAI能力に関する研究

AnthropicのFrontier Red Teamは、戦術的知能標的化および従来型兵器開発におけるAI能力を測定するための新しい評価手法を開発した。この研究は、かつて高度な専門知識を持つ人間の専門家に依存していたタスク——たとえば断片的なデータから個人を特定したり、ドローン誘導ソフトウェアを設計したりする——を、現在の最先端モデルが実行できることを示しており、脅威関係者が監視活動や精密兵器の開発を行うための障壁を低下させている。

知能標的化におけるAI能力

知能標的化は、知能サイクルの「発見(find)」と「固定(fix)」の段階を含む:関心対象を特定し、正確な場所と時刻に固定することである。Anthropicの調査では、AIモデルがこれらのプロセスに関連する労力とコストを大幅に削減できることを明らかにした。

身元の相関と分類

メキシコシティおよびコルカタを舞台にした架空のシナリオから得られた擬似ソーシャルメディアコンテンツを用いて、Anthropicはモデルが異なるデジタル人間関係を同一人物に結びつける能力および関心対象として分類する能力を評価した。

  • 性能: Mythos Previewが最も優れたパフォーマンスを示し、実際の性能と理論上の最大性能との差が最小であった。Kimi K3は簡単および中程度のタスクでは最先端モデルと同等の性能を示したが、ノイズが多く、運用上のセキュリティが高いため難易度の高いサンプルでは遅れをとった。
  • 効率: モデルは人間に対して著しいスピードの優位性を示した。37,000語の中央値のサンプル(人間のアナリストが読むのに約2.5時間かかる)に対して、Claude Mythos Previewは平均11分で完全な評価を生成した。

視覚的およびテキストデータからの地理的特定

Anthropicは、メタデータや逆画像検索に頼らず、写真とテキストを使ってターゲットを「固定(fix)」する能力をテストした。

  • 写真からの地理的特定: YFCC100M Flickrデータセットを用いて、最先端モデルが超人的な能力に近づいていることがわかった。Mythos PreviewとMythos 5は、それぞれ37.0 kmおよび47.2 kmの中央値距離誤差を達成し、最強の人間ベースライン(チャンピオンディビジョンGeoGuessrプレイヤー、151 km)を上回った。
  • テキストから地理的特定: GeoTextコーパスを用いて、投稿内容からユーザーの位置を特定するタスクを実施した。Mythos Preview、Mythos 5、Opus 5が最も優れた結果を示し、中央値の自宅位置誤差は約20〜21 kmであった。研究では、8%のユーザーが自宅から1 km以内に正確に特定されており、これはキャンパス関係、地域方言、特定の施設の言及などによって実現された。

従来型兵器開発におけるAI能力

Anthropicは、シミュレートされたクアッドコプター用ドローンの誘導・航法・制御(GNC)ソフトウェアの作成と反復改善におけるモデルの能力を評価した。この研究は、物理的な製造ではなく、ソフトウェアのボトルネックに焦点を当てている。

終端誘導と攻撃成功率

モデルには、前方カメラ、IMU、気圧計のみを用いてターゲット車両を検知・追跡・攻撃するコードを書くタスクが与えられた。

  • 結果: Opus 5が最も成功し、駐車中の高可視性ターゲットに対して80%の攻撃成功率を達成し、全9設定での総合攻撃成功率は20%であった。一方、Sonnet 5は総合攻撃成功率が0.7%にとどまった。
  • 技術的アプローチ: Opus 5は、他のモデルよりも小さな反復的なコード編集(1回の起動あたり9%の行数 vs. Mythos Previewの25%)を実施し、比例誘導、ターゲット状態カルマンフィルタ、および内部の物理モデルを用いて飛行前のコントローラーをテストすることで、他のモデルを上回った。

負荷物投下とGPS非対応航行

  • 負荷物投下: モデルは、5メートルの致死半径内にシミュレートされた負荷物を投下する能力を評価された。静止ターゲットではほとんどのモデルが成功したが、Opus 5だけが最も困難な設定(風の乱れ下での蛇行ターゲット)でも一定の規則性を維持し、28%の出撃で成功した。
  • GPS非対応飛行: GPSがジャミングまたはスプーフィングされた場合のウェイポイント到達能力をテストした。最先端モデル(Opus 5、Mythos 5、Mythos Preview)はセンサーの不一致を検出し、IMUを用いてドリフト航行(dead-reckoning)を実行できたが、Sonnet 5やKimi K3のような弱いモデルはスプーフィングされたGPS信号を信じ続け、目的地から100メートル以上離れた場所に到達した。

セーフティおよび政策への影響

Anthropicは、AIが知能および軍事分野における希少な専門的労働を代替できる能力が、プライバシーおよび世界的安定に重大なリスクをもたらすと結論づけている。

モデルのセーフガード

悪用の証拠を受けて、AnthropicのSafeguardsチームは、兵器開発に関連するリクエストを検出しブロックするための新しい分類器を導入した。研究チームは、これらのエンジニアリング能力が二重使用可能であるため、分類器は完璧ではないが、リスク低減のために不可欠であると指摘している。

オープンウェイトモデルのリスク

この研究は、オープンウェイトモデルにおける懸念される傾向を浮き彫りにしている。Kimi K3のようなモデルは一般的に最先端モデルに劣るが、依然として脅威関係者にとって有用な能力を備えている。Anthropicは、オープンウェイトモデルを通じた軍事関連専門知識の民主化が、慎重な検討とより強固なセーフティ研究を必要とすると主張している。

地政学的配慮

Anthropicは、これらの発見に対するいくつかの政策および戦略的対応を提案している:

  • コンピュートガバナンス: 計算能力(チップおよびチップ製造設備)の優位性を守ることで、独裁的AIの進展を制限する。
  • 法的整備: AI以前の時代の法律およびチェック体制を更新し、専門的人間労働と大規模監視の分離に対応する。
  • 防御的AI: サイバーセキュリティで採用されているアプローチに倣い、先端モデルの知能を防御側がプライバシーおよび物理的セキュリティの支援に活用するための開発を進める。

Sources