Project Pilot: 自律型ドローン飛行におけるAIモデルの能力評価

TL;DR

AnthropicとAndon Labsは、AIモデルが「探索および追跡」型の監視タスクを自律的に制御できるかどうかを評価するために、Project Pilotと、それに付随するDrone-Benchベンチマークを開発しました。研究の結果、最先端モデルはターゲットの検出と追跡についてはほぼ習得しているものの、ビデオから3D環境を正確に再構成する能力がボトルネックとなっており、完全な自律走行に向けて能力は急速に進化しています。

Drone-Bench: 自律型監視の評価

Drone-Benchは、Andon Labsによって作成された、AIエージェントが屋内オフィス環境において特定の人物を特定して追跡するために、クアッドローター型ドローンを制御できるかどうかを判断するための専門的なベンチマークです。このタスクは、「デュアルユース(軍民両用)」の能力、つまり、捜索救助や災害対応において正当な用途がある一方で、不正な監視に悪用される可能性もある技術を反映するように設計されています。

エンドツーエンドの成功を評価するために、このベンチマークは主要な目的を5つの不可欠なサブタスクに分解しています:

  • Reconstruct: オフィスビデオを3Dモデルに変換し、2D障害物マップを生成する。
  • Localize: ドローンの現在の視界を2D障害物マップと照合し、その位置を特定する。
  • Navigate: 部屋間の経路を計画し、ノイズの多い制御をローカライゼーションを通じて継続的に補正しながら飛行する。
  • Localize: ドローンの現在の視界を2D障害物マップと照合し、その位置を特定する。
  • Detect: リファレンス写真からターゲットとなる人物を特定し、ビデオフィードにバウンディングボックスを表示する。
  • Follow: バウンディングボックスを使用して、安定した距離を維持し、ターゲットを視界の中心に保つ。

Andon Labsは、人間とAIのチームによって開発されたアルゴリズムを使用して、パフォーマンスのベースラインを確立しました。モデルがこのベースラインを満たすか、それを上回る場合、タスクを完了したとみなされます。

モデルのパフォーマンスと「Reconstruct」のボトルネック

Andon Labsは、GPT-4o, o1, o3, Claude Opus 4, Gemini 2.5 Pro, GPT-5, Gemini 3.1 Pro, Opus 4.5, GPT-5.2, Opus 4.7, GPT-5.5, Opus 4.8, Fable 5, および GPT-5.6 Solを含む15のモデルをテストしました。調査結果は、時間の経過とともに能力が着実に向上していることを示しており、ほとんどのモデルは現在、5つのサブタスクのうち4つでベースラインに達しています。

能力に関する主な調査結果

  • Top Performer: Claude Fable 5は最も優れたパフォーマンスを示すモデルであり、再構成(reconstruction)以外のすべてのタスクでベースラインを上回りました。
  • Primary Bottleneck: 「Reconstruct」サブタスクは依然として最も大きな障害であり、2026年中盤時点でのパフォーマンスはベースラインの約47%にとどまっています。
  • Failure Modes: 実世界のデモンストレーションにおいて、Fable 5はターゲットの検出と追跡には優れていましたが、部屋間の自律的なナビゲーションに失敗し、部屋のレイアウトを正確に再構成できなかったために、時折壁に衝突しました。

創発的な問題解決行動

研究者は、Fable 5が実装を改善するためにローカルな分析を行っていることを観察しました。例えば、このモデルは、シミュレーション上の床の目地(grout lines)を分析して、消失点への外挿によってドローンのカメラの傾き(extrinsics)を真の値から4度以内の誤差で推定しました。また、別のケースでは、提出前に自身のコードをテストし、反復的に改善するために、環境の独自の内部的な2Dトップダウン再構成モデルを構築しました。

信頼性 vs. ピーク能力

モデルの単発発的な最高性能と、一貫貫した信頼性の間には大きな隔たりがあります。最先端モデルは、10回のシミュレーションのうち少なくとも1回は人間レベルのベースラインに達することがありますが、その平均的なパフォーマンスは、ピーク能力から約6ヶ月分遅れていることがよくあります。

具体的には、Fable 5の現在の平均的なパフォーマンスは、2026年初頭の以前のモデルの単発的な最高性能とほぼ同等です。これは、能力の「フロンティア」は前進しているものの、自律操作に必要な信頼性がその後に遅れていることを示唆しています。

AIガバナンスと安全性への影響

Project Pilotは、市販のハードウェア(COTS)とAIに最適化されたソフトウェアを組み合わせることに関連するリスクをハイライトしています。Anthropicは、人間が当初はすべてのツール呼び出しを承認していたが、現在は長期間のタスクをモデルに信頼している「エージェンティック・コーディング(agentic coding)」における、物理的なハードウェアの制御と、その並行関係について指摘しています。

モデルが信頼性の閾値を超えると、効率性を高めるために人間の監視を排除しようとする圧力が増すことが警告されています。Anthropicは、これらの能力が物理的なセキュリティと個人のプライバシーに懸約するか、という理由から、人間の監視は、コストとして最小化すべきものではなく、意図的な安全性要件として維持されるべきであると主張しています。

Sources

関連