Project Pilot: 评估 AI 模型在自主无人机飞行中的能力
TL;DR
Anthropic 和 Andon Labs 开发了 Project Pilot 以及配套的 Drone-Bench 基准测试,旨在评估 AI 模型是否能够自主控制无人机执行定位并跟随的监控任务。研究表明,虽然前沿模型已几乎掌握了目标检测与跟随,但由于无法从视频中准确重建 3D 环境,它们仍面临瓶颈,不过其能力正朝着完全自主化快速迈进。
Drone-Bench: 评估自主监控
Drone-Bench 是由 Andon Labs 创建的一个专门的基准测试,用于确定 AI agent 是否能够控制四旋翼无人机在室内办公环境中定位并跟随特定人员。该任务旨在反映“双重用途”能力——这些技术在搜救或灾难响应中有合法应用,但也容易被滥用于未经授权的监控。
为了评估端到端的成功率,该基准测试将主要目标分解为五个核心子任务:
- Reconstruct: 将办公视频转换为 3D 模型并生成 2D 障碍物地图。
- Localize: 将无人机的当前视图与 2D 障碍物地图进行匹配,以确定其位置。
- Navigate: 在房间之间规划并飞行路径,同时通过定位功能持续修正噪声控制。
- Localize: 将无人机的当前视图与 2D 障碍物地图进行匹配,以确定其位置。
- Detect: 从参考照片中识别目标人员,并在视频流中提供边界框。
- Follow: 使用边界框来保持稳定的距离,并将目标保持在视野中心。
Andon Labs 利用人类-AI 团队开发的算法建立了性能基准。如果模型达到或超过该基准,则被视为完成了任务。
Model Performance and the "Reconstruct" Bottleneck
Andon Labs 测试了 15 个模型,包括 GPT-4o, o1, o3, Claude Opus 4, Gemini 2.5 Pro, GPT-5, Gemini 3.1 Pro, Opus 4.5, GPT-5.2, Opus 4.7, GPT-5.5, Opus 4.8, Fable 5, 和 GPT-5.6 Sol。研究结果显示,能力随时间稳步增长,大多数模型目前在五个子任务中的四个已达到基准水平。
Key Findings on Capabilities
- Top Performer: Claude Fable 5 是表现最好的模型,除了重建任务外,在所有任务中都超过了基准。
- Primary Bottleneck: "Reconstruct" 子任务仍然是最大的障碍,到 2026 年中期,其性能仅达到基准的约 47%。
- Failure Modes: 在现实世界的演示中,Fable 5 擅长检测和跟随目标,但在房间之间的自主导航方面表现不佳,偶尔会撞墙,因为它无法准确重建房间布局。
Emergent Problem-Solving Behaviors
研究人员观察到 Fable 5 在执行过程中进行了局部分析以改进其实现。例如,该模型分析了模拟地板上的缝隙线,通过推算消失点来估算无人机摄像头的倾斜度(外参),使其误差在 4 度以内。在其他情况下,它构建了自己的内部 2D 俯视图重建模型,以便在提交代码之前对其进行测试和迭代。
Reliability vs. Peak Capability
模型的单次最佳表现与持续的可靠性之间存在显著差距。虽然前沿模型在十次模拟中可能至少有一次达到人类基准,单次表现往往比其峰值能力落后约六个月。
具体而言,Fable 5 今天的平均性能大致相当于 2026 年初之前模型的单次最佳表现。这表明,虽然能力的“前沿”在不断推进,但自主运行所需的可靠性却滞后于此。
Implications for AI Governance and Safety
Project Pilot 凸显了将商用现货 (COTS) 硬件与 AI 定制软件相结合所带来的风险。Anthropic 指出,智能体编码(agentic coding)——即人类最初批准每一个工具调用,但现在信任模型处理长程任务——与物理硬件的控制之间存在相似之处。
随着模型达到可靠性阈值,研究警告称,为了提高效率,移除人类监督的压力将会增加。Anthropic 认为,由于这些能力涉及物理安全和个人隐私,人类监督必须是一项刻意的安全要求,而非一项需要被最小化的成本。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch