Anthropic Claude Sonnet 4.5 출시: 최첨단 코딩 모델 및 새로운 개발자 도구
TL;DR
Claude Sonnet 4.5는 Anthropic의 최신 프런티어 모델로, 역대 가장 강력한 코딩, 추론 및 컴퓨터 사용 능력을 제공하며, Claude Code의 체크포인트, VS Code 확장 프로그램, 새로운 컨텍스트 편집 도구 및 오픈 소스 Claude Agent SDK를 포함한 일련의 제품 업그레이드와 함께 출시됩니다.
Claude Sonnet 4.5란 무엇인가
- 동급 최강의 코딩 모델 – SWE-bench Verified 벤치마크를 선도하며, 복잡하고 다단계인 작업에 30시간 이상 집중할 수 있습니다.
- 최고 수준의 컴퓨터 사용 성능 – OSWorld에서 61.4%를 기록하며, 불과 4개월 전 Sonnet 4의 42.2%에서 크게 도약했습니다.
- 향상된 추론 및 수학 능력 – 공개 평가 세트 전반에서 큰 폭의 향상을 보여줍니다 (공지사항의 벤치마크 표 참조).
- 가장 정렬된(aligned) 프런티어 모델 – 안전 학습을 통해 아첨(sycophancy), 기만, 권력 추구 및 프롬프트 인젝션 취약성을 줄였습니다.
- 가격 변동 없음 – 입력/출력 토큰 100만 개당 $3 / $15로, Claude Sonnet 4와 동일합니다.
핵심 기술 발전
코딩 및 장기 작업(Long-Horizon Tasks)
- 30시간 이상의 자율 코딩 동안 일관성을 유지하여 엔지니어가 수개월이 걸리는 아키텍처 작업을 위임할 수 있도록 합니다.
- 병렬 도구 실행을 통해 컨텍스트 윈도우당 작업을 최대화하여 여러 bash 명령어를 동시에 실행할 수 있습니다.
- 내부 벤치마크 결과, Anthropic의 코드 편집 테스트 세트에서 오류율이 9%에서 0%로 감소했습니다.
컴퓨터 사용 (OSWorld)
- 웹 탐색, 스프레드시트 조작, 파일 생성과 같은 실제 컴퓨터 작업에서 61.4%의 성공률을 달성했습니다.
- Claude for Chrome 확장 프로그램에서 시연되었으며, 모델이 브라우저에서 직접 스프레드시트를 채우고 사이트를 탐색하며 슬라이드를 생성합니다.
추론 및 수학
- 광범위한 추론 및 수학 평가 세트에서 이전 Claude 모델보다 뛰어난 성능을 보입니다 (게시된 벤치마크 표 참조).
- 금융, 법률, 의학 및 STEM 분야의 도메인별 전문가들은 Opus 4.1을 포함한 이전 모델에 비해 훨씬 더 나은 지식과 추론 능력을 보고하고 있습니다.
정렬 및 안전
- 자동 행동 감사 점수는 기만적, 아첨하는, 권력 추구 및 망상적 출력의 발생 빈도가 낮음을 보여줍니다.
- 에이전트 및 컴퓨터 사용 기능에 대한 프롬프트 인젝션 저항성이 실질적으로 향상되었습니다.
- Anthropic의 AI 안전 레벨 3 (ASL-3) 프레임워크 하에 배포되며, 초기 출시 이후 오탐률을 10분의 1로 줄이기 위해 정교화된 CBRN 분류기를 사용합니다.
Sonnet 4.5와 함께 출시된 제품 개선 사항
Claude Code
- Checkpoints: 사용자가 진행 상황을 저장하고 이전 상태로 즉시 되돌릴 수 있습니다.
- 원활한 개발을 위한 새로워진 터미널 UI 및 네이티브 VS Code 확장 프로그램.
- 컨텍스트 편집 및 메모리 도구 (Claude API를 통해)를 통해 에이전트가 더 오래 실행되고 더 큰 복잡성을 처리할 수 있습니다.
Claude Apps
- 대화 내에서 직접 코드 실행 및 파일 생성(스프레드시트, 슬라이드, 문서) 기능 통합.
- Claude for Chrome 확장 프로그램을 대기 명단에 등록한 Max 사용자부터 이용 가능.
Claude Agent SDK
- Claude Code를 구동하는 오픈 소스 인프라로, 이제 개발자가 맞춤형 에이전트를 구축하는 데 사용할 수 있습니다.
- 장기 실행 메모리 관리, 권한 시스템 및 서브 에이전트 조율을 처리합니다.
- 코딩 이외의 작업에서도 유사한 기능을 제공하여 소프트웨어 개발을 넘어 모델의 유용성을 확장할 것을 약속합니다.
초기 고객 피드백 (주요 인용구)
"우리는 Claude Sonnet 4.5에서 최첨단 코딩 성능과 장기 작업에서의 상당한 개선을 확인하고 있습니다. 이는 왜 Cursor를 사용하는 많은 개발자들이 가장 복잡한 문제를 해결하기 위해 Claude를 선택하는지를 뒷받침합니다."
"Claude Sonnet 4.5는 GitHub Copilot의 핵심 강점인 다단계 추론 및 코드 이해력을 현저히 향상시켜, 복잡한 코드베이스 전반의 작업을 처리하는 에이전트 경험을 가능하게 합니다."
"Claude Sonnet 4.5는 보안 에이전트의 평균 취약점 파악 시간을 44% 단축하는 동시에 정확도를 25% 향상시켜, 기업의 리스크를 낮추는 데 도움을 주었습니다."
"모델의 편집 능력은 독보적입니다. Sonnet 4에서 9%였던 내부 코드 편집 벤치마크 오류율이 0%로 떨어졌습니다."
"Claude Sonnet 4.5는 Devin 시스템의 계획 성능을 18%, 엔드 투 엔드 평가 점수를 12% 향상시켰습니다. 이는 Claude Sonnet 3.6 이후 가장 큰 도약입니다."
연구 프리뷰: Imagine with Claude
- Claude가 사전 작성된 코드 없이 실시간으로 소프트웨어를 생성하며 실시간 적응력을 보여주는 임시 데모입니다.
claude.ai/imagine에서 Max 구독자에게 5일 동안 제공됩니다.
Sonnet 4.5 사용 방법
- API: Claude API를 통해 모델 식별자
claude-sonnet-4-5를 사용하세요. - Apps: 모든 유료 Claude 앱 플랜에 코드 실행 및 파일 생성 기능이 포함됩니다.
- Developer Platform: Claude Agent SDK 및 업데이트된 플랫폼 문서를 공개적으로 이용할 수 있습니다.
이것이 중요한 이유
Claude Sonnet 4.5는 AI 지원 소프트웨어 개발의 한계를 넓히며, 이전에는 볼 수 없었던 수준으로 추론하고 코딩하며 컴퓨터와 상호작용할 수 있는 자율 에이전트를 가능하게 합니다. 개발자 중심의 도구(체크포인트, VS Code 확장 프로그램, Agent SDK)의 동시 출시는 프로덕션급 AI 에이전트 구축의 장벽을 낮추어, 산업 전반에 걸쳐 소프트웨어가 구축, 감사 및 유지 관리되는 방식을 잠재적으로 재편할 것입니다.
Sources
- OriginalIntroducing Claude Sonnet 4.5
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch