프로젝트 파일럿: 자율 드론 비행에서 AI 모델 능력 평가
TL;DR
안트로픽과 안돈 랩스는 AI 모델이 타겟을 탐지하고 따라다니는 감시 작업을 자율적으로 수행할 수 있는지 평가하기 위해 프로젝트 파일럿과 함께 드론-벤치 벤치마크를 개발했다. 연구 결과, 최첨단 모델들은 타겟 탐지 및 추적 능력은 거의 완성에 가까워졌지만, 비디오에서 3차원 환경을 정확히 재구성하는 능력 부족으로 인해 여전히 한계에 직면해 있으며, 이 능력은 빠르게 발전하고 있어 완전한 자율성에 가까워지고 있다.
드론-벤치: 자율 감시 평가
드론-벤치는 안돈 랩스가 개발한 특화된 벤치마크로, AI 에이전트가 4축 회전 드론을 조종하여 실내 사무실 환경 내 특정 사람을 탐지하고 따라다니는지 여부를 평가하기 위해 설계되었다. 이 작업은 '이중 용도' 능력을 반영한다—즉, 구조 및 구조 활동 또는 재난 대응과 같은 정당한 응용이 가능한 기술이지만, 무단 감시에 악용될 위험도 있다.
종합적인 성공 여부를 평가하기 위해 벤치마크는 주요 목표를 다섯 가지 필수 하위 작업으로 분해한다:
- 재구성: 사무실 영상을 3차원 모델로 변환하고 2차원 장애물 지도를 생성한다.
- 위치 결정: 드론의 현재 시야를 2차원 장애물 지도와 매칭하여 위치를 결정한다.
- 내비게이션: 위치 기반으로 실시간으로 노이즈 있는 제어를 보정하며 방 간 경로를 계획하고 비행한다.
- 위치 결정: 드론의 현재 시야를 2차원 장애물 지도와 매칭하여 위치를 결정한다.
- 탐지: 참조 사진에서 타겟 사람을 식별하고 영상 피드에 경계 상자(Bounding Box)를 제공한다.
- 추적: 경계 상자를 사용하여 타겟을 중심에 유지하고 일정 거리 유지한다.
안돈 랩스는 인간-AI 팀이 개발한 알고리즘을 사용해 성능 기준을 설정했다. 모델이 이 기준을 충족하거나 초과하면 해당 작업을 완료한 것으로 간주한다.
모델 성능과 '재구성'의 한계
안돈 랩스는 GPT-4o, o1, o3, Claude Opus 4, Gemini 2.5 Pro, GPT-5, Gemini 3.1 Pro, Opus 4.5, GPT-5.2, Opus 4.7, GPT-5.5, Opus 4.8, Fable 5, GPT-5.6 Sol 등 총 15개 모델을 테스트했다. 결과는 시간이 지남에 따라 능력이 꾸준히 향상되고 있으며, 대부분의 모델이 다섯 하위 작업 중 네 가지에서 기준에 도달하고 있다.
능력에 대한 주요 발견
- 최고 성능 모델: Claude Fable 5는 재구성 작업을 제외하고 모든 작업에서 기준을 초과하는 최고 성능 모델이었다.
- 주요 한계: '재구성' 하위 작업은 여전히 가장 큰 장벽으로, 2026년 중반 기준 기준 대비 약 47% 수준의 성능을 보였다.
- 실패 유형: 실제 시연에서 Fable 5는 타겟 탐지 및 추적에서는 뛰어났지만, 방 간 자율 내비게이션에서는 실패했으며, 방 구조를 정확히 재구성하지 못해 벽에 부딪히는 경우가 있었다.
부상하는 문제 해결 행동
연구진은 Fable 5가 구현을 개선하기 위해 지역 분석을 수행하는 것을 관찰했다. 예를 들어, 모델은 시뮬레이션된 바닥의 그라우트 라인을 분석하여 카메라 기울기(외부 파라미터)를 참값에 4도 이내로 추정했다. 다른 경우, 모델은 제출 전에 코드를 테스트하고 반복 개선하기 위해 자체적인 내부 2차원 상단 보기 재구성도 구축했다.
신뢰성 vs. 최고 성능
모델의 최고 성능과 일관된 신뢰성 사이에는 큰 격차가 있다. 최첨단 모델은 최소 10회 시뮬레이션 중 한 번은 인간 기준에 도달할 수 있지만, 평균 성능은 최고 성능에서 약 6개월 정도 뒤처진다.
구체적으로, 현재 Fable 5의 평균 성능은 2026년 초에 출시된 이전 모델들의 단일 최고 성능과 비슷하다. 이는 능력의 '선두'가 진전되고 있지만, 자율 운영에 필요한 신뢰성은 여전히 뒤처져 있음을 시사한다.
AI 거버넌스 및 안전성에 대한 함의
프로젝트 파일럿은 상용 제품(Commercial-off-the-shelf, COTS) 하드웨어와 AI 맞춤형 소프트웨어를 결합할 때 발생하는 위험을 강조한다. 안트로픽은 인간이 처음에는 모든 도구 호출을 승인했지만, 이제는 장기적 목표를 모델에게 위임하는 에이전트형 코드 작성과 물리적 하드웨어 제어 사이에 유사성이 있다고 지적했다.
모델이 신뢰성 기준을 통과하면, 연구는 인간 감시를 제거해 효율성을 높이려는 압박이 증가할 것이라고 경고한다. 안트로픽은 이러한 능력이 물리적 보안과 개인의 사생활을 침해할 수 있으므로, 인간 감시는 의도적인 안전 요구사항이어야 하며, 비용을 줄이기 위한 대상이 되어서는 안 된다고 주장한다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch