Anthropic Claude 3.5 Sonnet 컴퓨터 사용 기능
Anthropic는 최신 버전의 Claude 3.5 Sonnet이 컴퓨터를 사용할 수 있도록 하는 공개 베타를 출시했습니다. 이 모델은 사용자의 명령을 따라 커서를 이동하고 화면의 특정 위치를 클릭하며 가상 키보드를 통해 텍스트를 입력할 수 있어, 전용 도구에 의존하지 않고 인간처럼 소프트웨어와 상호작용할 수 있습니다.
기술적 구현 및 연구
Claude 3.5 Sonnet은 다중 모달성과 추론 능력을 결합하여 컴퓨터 사용 기능을 달성합니다. 모델은 사용자 화면의 스크린샷을 해석하고 커서를 이동하고 올바른 위치를 클릭하기 위해 정확한 픽셀 좌표를 계산합니다.
개발 과정에서 도출된 주요 기술적 통찰은 다음과 같습니다:
- 픽셀 수준 정확도: 정확한 픽셀 계산 능력을 훈련시키는 것이 신뢰할 수 있는 마우스 명령을 위해 필수적이었으며, 일반적인 LLM이 정밀한 계산에 어려움을 겪는 문제를 해결했습니다.
- 일반화 능력: 모델은 계산기나 텍스트 편집기와 같은 간단한 소프트웨어에서 훈련을 시작해, 텍스트 기반 프롬프트에 기반한 복잡한 논리적 단계의 시퀀스를 수행하는 데 빠르게 일반화하는 능력을 보였습니다.
- 자기 수정: 작업 중 장애물에 부딪힐 경우 모델이 스스로 수정하고 동작을 재시도하는 것을 관찰할 수 있었습니다.
- 성능 벤치마크: OSWorld 평가에서 Claude 3.5 Sonnet은 14.9%의 점수를 기록했으며, 다음으로 높은 점수를 기록한 AI 모델의 7.7%보다 훨씬 높았지만, 여전히 인간 수준 성능(70-75%)에는 훨씬 못 미쳤습니다.
안전 프레임워크 및 리스크 완화
Anthropic는 컴퓨터 사용 기능을 기존 인지 능력의 접근성을 낮추는 방식으로 분류하며, 이 능력이 해당 능력을 증가시키는 것은 아니라고 주장합니다. 따라서 업데이트된 Claude 3.5 Sonnet은 회사의 책임 있는 확장 정책에 따라 AI 안전 수준 2를 유지하고 있습니다.
주요 안전 우려 사항
- 프롬프트 주입 공격: Claude는 인터넷에 연결된 컴퓨터의 스크린샷을 해석하기 때문에, 화면에 악성 콘텐츠가 존재할 경우 사용자 지시를 무시하고 악성 지시로 대체되는 프롬프트 주입 공격에 취약합니다.
- 고의적 오용: 오용을 방지하기 위해 Anthropic는 오용을 탐지하는 분류기 시스템을 구현했습니다. 특히, 선거 관련 활동을 모니터링하고 있으며, 웹 도메인 등록, 정부 웹사이트 상호작용, 소셜 미디어 게시를 모델이 하도록 유도하는 시스템을 구현했습니다.
Anthropic는 AI 안전 수준 2에서 컴퓨터 사용 기능을 도입함으로써, 치명적인 리스크가 더 흔한 수준 3 또는 4에 도달하기 전에 안전 문제를 해결할 수 있다고 주장합니다.
현재 한계 및 향후 방향
Anthropic는 현재 컴퓨터 사용 기능이 "모델에 도구를 맞추는 것"에서 "도구에 모델을 맞추는 것"으로의 전환이라고 설명합니다. 그러나 몇 가지 한계가 여전히 존재합니다:
- 입력 제약: 현재 모델은 드래그하거나 줌 인/아웃과 같은 동작을 수행할 수 없습니다.
- 관찰 갭: Claude는 화면을 "스크린샷의 플립북"으로 보며 지속적인 비디오 스트림으로 보지 않기 때문에, 짧은 시간 동안만 나타나는 알림이나 동작을 놓칠 수 있습니다.
- 신뢰성: 현재 이 기능은 느리고 오류가 많으며, 화면 녹화를 우연히 중단하거나 관련 없는 콘텐츠 탐색으로 작업에서 벗어나는 사례가 보고되었습니다.
Anthropic는 이 기능이 발전함에 따라 비개발자도 쉽게 사용할 수 있도록 속도, 신뢰성, 구현 용이성을 향상시킬 계획입니다.
Sources
- OriginalDeveloping a computer use model
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch