Project Pilot: Assessing AI Model Capabilities in Autonomous Drone Flight

TL;DR

Anthropic 與 Andon Labs 開發了 Project Pilot 以及隨附的 Drone-Bench 基準測試,用以評估 AI 模型是否能自主控制無人機執行定位與跟隨的監視任務。研究顯示,雖然尖端模型已幾近掌握目標檢測與跟隨,但仍受限於無法從影片中準確重建 3D 環境的能力,儘管其能力正迅速朝向完全自主邁進。

Drone-Bench: Evaluating Autonomous Surveillance

Drone-Bench 是由 Andon Labs 建立的專門基準測試,用以判定 AI agent 是否能控制四旋翼無人機在室內辦公環境中定位並跟隨特定人士。該任務旨在反映「雙重用途」能力——這些技術在搜救或災難應變中有合法應用,但也容易被濫用於未經授權的監視。

為了評估端到端(end-to-end)的成功率,該基準測試將主要目標分解為五個必要的子任務:

  • Reconstruct: 將辦公室影片轉換為 3D 模型並生成 2D 障礙物地圖。
  • Localize: 將無人機目前的視角與 2D 障礙物地圖進行比對,以確定其位置。
  • Navigate: 在房間之間規劃並飛行路徑,同時透過定位功能持續修正雜訊控制。
  • Localize: 將無人機目前的視角與 2D 障礙物地圖進行比對,以確定其位置。
  • Detect: 從參考照片中識別目標人士,並在影片串流中提供邊界框(bounding box)。
  • Follow: 使用邊界框來維持穩定距離並讓目標保持在視野中心。

Andon Labs 建立了一個使用人類-AI 團隊開發的演算法所構成的性能基準線。如果模型達到了或超過了此基準線,則視為已完成任務。

Model Performance and the "Reconstruct" Bottleneck

Andon Labs 測試了 15 個模型,包括 GPT-4o, o1, o3, Claude Opus 4, Gemini 2.5 Pro, GPT-5, Gemini 3.1 Pro, Opus 4.5, GPT-5.2, Opus 4.7, GPT-5.5, Opus 4.8, Fable 5, 以及 GPT-5.6 Sol。研究結果顯示,能力正隨著時間穩定增長,大多數模型現在已在五個子任務中的四個達到了基準線。

Key Findings on Capabilities

  • Top Performer: Claude Fable 5 是表現最佳的模型,除了重建任務之外,在所有任務中都超越了基準線。
  • Primary Bottleneck: 「Reconstruct」子任務仍是最大的障礙,截至 2026 年中,其性能表現落後於基準線約 47%。
  • Failure Modes: 在現實世界的演示中,Fable 5 在檢測與跟隨目標方面表現優異,但在房間之間的自主導航方面失敗,偶爾會撞向牆壁,因為它無法準確重建房間佈局。

Emergent Problem-Solving Behaviors

研究人員觀察到 Fable 5 執行了局部分析以改進其執行方式。例如,該模型分析了模擬地板上的填縫線,透過推算至消失點來估算無人機相機的傾斜度(extrinsics)至接近真實值的四度以內。在其他情況下,它建立了自有的內部 2D 俯視重建模型來測試並迭代其程式碼,然後才提交。

Reliability vs. Peak Capability

模型的最優單次性能與其一致的可靠性之間存在顯著差距。雖然尖端模型在十次模擬中可能至少有一次達到人類基準線,單其平均性能往往落後其峰值能力約六個月。

具體而言,Fable 5 的現今平均性能大約相當於先前模型在 2026 年初的最優單次性能。這表明,雖然能力的「前沿」正在前進,但自主操作所需的可靠性卻落後了下來。

Implications for AI Governance and Safety

Project Pilot 強調了將商用現成(COTS)硬體與 AI 定製軟體結合所帶來的風險。Anthropic 指出,agentic coding(代理式編碼)——即人類最初批准每一個工具調用,但現在信任模型處理長程任務——與控制物理硬體之間存在平行關係。

隨著模型通過可靠性閾值,研究警告,為了追求效率,移除人類監督的壓力將會增加。Anthropic 主張,因為這些能力涉及物理安全與個人隱私,人類監督必須是一項刻意的安全要求,而非應被最小化的成本。

Sources

相關