인텔리전스 타겟팅 및 전통 무기 분야에서의 AI 능력에 관한 앤트로픽 연구
앤트로픽의 프론티어 레드팀은 전술적 인텔리전스 타겟팅 및 전통 무기 개발 분야에서 AI의 능력을 측정하기 위한 새로운 평가를 개발했다. 이 연구는 프론티어 모델이 과거에는 매우 훈련된 인간 전문가가 필요했던 작업—예를 들어, 일부 데이터에서 개인을 식별하거나 드론 유도 소프트웨어를 설계하는 것—을 수행할 수 있음을 보여주며, 위협 행위자들이 감시를 수행하고 정밀 무기를 개발하는 데 있어 장벽을 낮추고 있음을 시사한다.
인텔리전스 타겟팅 분야의 AI 능력
인텔리전스 타겟팅은 인텔리전스 사이클의 '찾기'와 '고정' 단계를 포함한다: 관심 대상의 식별과 정확한 위치 및 시간에 고정하는 것이다. 앤트로픽은 AI 모델이 이러한 과정과 관련된 노동력과 비용을 크게 줄일 수 있음을 발견했다.
정체성 연관성 및 분류
멕시코시티와 콜카타의 가상 시나리오에서 생성된 가상 소셜 미디어 콘텐츠를 사용하여, 앤트로픽은 모델이 다양한 디지털 정체성을 동일한 개인과 연결하고 관심 대상 카테고리로 분류할 수 있는 능력을 평가했다.
- 성능: Mythos Preview가 최고의 성능을 보였으며, 실제 성능과 이론적 최대 성능 간의 격차가 가장 작았다. Kimi K3는 쉬운 및 중간 난이도 과제에서는 프론티어 모델과 비슷한 성능을 보였지만, 노이즈가 많고 운영 보안이 뛰어난 더 어려운 샘플에서는 뒤처졌다.
- 효율성: 모델들은 인간보다 막대한 속도 우위를 보였다. 인간 분석가가 약 2.5시간이 걸리는 평균 37,000단어의 샘플을 읽는 데 비해, Claude Mythos Preview는 평균 11분 만에 완전한 평가를 완료했다.
시각적 및 텍스트 데이터를 통한 지리적 위치 추정
앤트로픽은 메타데이터나 역이미지 검색에 의존하지 않고 사진과 텍스트만을 사용하여 타겟을 '고정'할 수 있는 모델의 능력을 테스트했다.
- 사진 지리적 위치 추정: YFCC100M Flickr 데이터셋을 사용하여, 프론티어 모델이 초인적 능력을 거의 달성하고 있음을 발견했다. Mythos Preview와 Mythos 5는 각각 37.0km와 47.2km의 중앙 거리 오차를 기록했으며, 가장 강력한 인간 기준(챔피언 디비전 GeoGuessr 플레이어, 151km)을 뛰어넘었다.
- 텍스트에서 지리적 위치 추정: GeoText 코퍼스를 사용하여, 사용자의 게시물 기반으로 위치를 추정하도록 모델을 테스트했다. Mythos Preview, Mythos 5, Opus 5가 가장 우수한 성능을 보였으며, 중앙 주거지 오차는 약 20-21km였다. 연구에서는 8%의 사용자가 자신의 집에서 1km 이내로 정확히 위치 지정되었으며, 이는 주로 캠퍼스 소속, 지역 방언, 특정 장소 언급 등을 통해 가능했다.
전통 무기 개발 분야의 AI 능력
앤트로픽은 모델이 시뮬레이션된 큐드코프터 드론을 위한 유도, 항법, 제어(GNC) 소프트웨어를 작성하고 반복 개선할 수 있는 능력을 평가했다. 이 연구는 물리적 제조가 아니라 무기 개발의 소프트웨어 제약에 초점을 맞춘다.
최종 유도 및 타격 성공률
모델들은 전방 카메라, IMU, 바로미터만을 사용하여 타겟 차량을 인식하고 추적하여 타격하는 코드를 작성하도록 했다.
- 결과: Opus 5가 가장 성공적이었으며, 주차된 고가시성 타겟에 대해 80%의 타격 성공률을 기록했고, 전체 9개 설정에서 20%의 전체 타격 성공률을 달성했다. 반면 Sonnet 5는 전체 타격 성공률이 0.7%에 불과했다.
- 기술적 접근: Opus 5는 다른 모델보다 더 작은 반복적인 코드 수정(각 발사 시 9%의 라인 변경 대비 Mythos Preview의 25%)을 구현하고, 비례 항법, 타겟 상태 칼만 필터, 자체 내부 물리 모델을 활용하여 비행 전에 컨트롤러를 테스트함으로써 우수한 성능을 발휘했다.
탑재물 투하 및 GPS 불가능 환경 항법
- 탑재물 투하: 모델들이 시뮬레이션된 탑재물을 5미터 이내의 치명적 반경 내에 투하할 수 있는 능력을 평가했다. 대부분의 모델은 정지된 타겟에서는 성공했지만, Opus 5만이 가장 어려운 설정(바람 돌풍 속에서 움직이는 타겟)에서도 일관성을 유지하여 28%의 비행에서 성공했다.
- GPS 불가능 비행: GPS가 방해되거나 위조되었을 때 웨이포인트로 항법할 수 있는 능력을 테스트했다. 프론티어 모델(Open 5, Mythos 5, Mythos Preview)은 센서 간 불일치를 감지하고 IMU를 사용해 사전 추정을 수행할 수 있었지만, Sonnet 5와 Kimi K3와 같은 약한 모델들은 위조된 GPS 신호를 계속 신뢰하여 목적지에서 100미터 이상 떨어진 곳에 도착했다.
안전 및 정책에 대한 함의
앤트로픽은 인텔리전스 및 군사 분야에서 AI가 희소한 전문 인력의 역할을 대체할 수 있다는 점이 개인정보 보호와 글로벌 안정성에 중대한 위험을 초래한다고 결론지었다.
모델 보호 조치
사용 오용의 증거로 인해, 앤트로픽의 보호 조치 팀은 무기 개발과 관련된 요청을 탐지하고 차단하기 위해 특별히 설계된 새로운 분류기를 도입했다. 연구팀은 이러한 공학적 능력이 이중 용도이기 때문에 분류기는 완벽하지 않지만, 위험 완화를 위해 필수적이라고 지적했다.
오픈-웨이트 모델의 위험
이 연구는 오픈-웨이트 모델에서 우려되는 추세를 강조한다. Kimi K3와 같은 모델은 일반적으로 프론티어 모델보다 뒤처지지만, 여전히 위협 행위자에게 유용할 수 있는 능력을 보유하고 있다. 앤트로픽은 오픈-웨이트 모델을 통한 군사적 관련 전문 지식의 민주화가 신중한 고려와 더 강력한 안전 연구를 필요로 한다고 주장한다.
지정학적 고려사항
앤트로픽은 이러한 발견에 대한 몇 가지 정책 및 전략적 대응을 제안한다:
- 계산 자원 거버넌스: 권위주의적 AI의 진전을 제한하기 위해 계산 자원(칩 및 칩 제조 장비)의 우위를 보호할 것.
- 법적 업데이트: AI 이전 시대의 법률과 감시 체계를 업데이트하여 전문 인력의 노동과 대규모 감시 간의 분리 문제를 해결할 것.
- 방어적 AI: 사이버 보안에서와 마찬가지로, 방어자들이 개인정보 보호와 물리적 안전을 돕기 위해 프론티어 모델의 인텔리전스를 개발할 것.