Anthropic Claude Sonnet 4.6 출시: 향상된 기능 및 1M-토큰 컨텍스트
TL;DR
Claude Sonnet 4.6은 이제 Anthropic의 Free, Pro 및 Claude Cowork 플랜의 기본 모델로 제공되며, Sonnet 4.5와 동일한 100만 토큰 컨텍스트 윈도우(베타)를 제공하면서 코딩, 컴퓨터 사용, 긴 컨텍스트 추론 및 에이전트 계획 능력이 눈에 띄게 향상되었습니다.
핵심 기술 업그레이드
전반적인 기술 향상 – Sonnet 4.6은 코딩, 컴퓨터 사용, 긴 컨텍스트 추론, 에이전트 계획, 지식 작업 및 디자인 능력을 개선했습니다. 이 모델의 지시 이행 일관성과 환각(hallucination) 감소는 이전 모델은 물론 기존의 Opus 4.5 프론티어 모델마저 능가하는 것으로 보고되었습니다.
1M-토큰 컨텍스트 윈도우 (베타) – 확장된 윈도우는 단일 요청에 전체 코드베이스, 긴 계약서 또는 수십 편의 연구 논문을 담을 수 있으며, Vending-Bench Arena 평가에서 보여지듯 해당 길이에서도 효과적인 추론 능력을 보여줍니다.
안전성 강화 – 광범위한 안전성 평가 결과, Sonnet 4.6은 "따뜻하고, 정직하며, 친사회적인" 성격을 지니며 주요한 고위험 미정렬(misalignment) 우려 없이 최근의 Claude 모델만큼 또는 그보다 더 안전한 것으로 나타났습니다. 프롬프트 인젝션(Prompt-injection) 저항성 또한 Sonnet 4.5에 비해 눈에 띄게 향상되었습니다.
컴퓨터 사용(Computer-Use) 기능
실험 단계에서 프로덕션급으로 – 2024년 10월 Anthropic의 첫 범용 컴퓨터 사용 모델이 출시된 이후, Sonnet 모델은 OSWorld 벤치마크에서 꾸준히 상승해 왔습니다. Sonnet 4.6은 이제 복잡한 스프레드시트 탐색 및 다단계 웹 양식 완성과 같은 작업에서 인간 수준의 성능을 달성합니다.
벤치마크 증거 – OSWorld-Verified 점수(2025년 7월 발표)에 따르면, Sonnet 4.6은 수백 개의 실제 소프트웨어 작업(Chrome, LibreOffice, VS Code 등)에서 이전 Sonnet 버전들을 능가하는 성능을 보여줍니다.
리스크 완화 – 프롬프트 인젝션 공격은 여전히 고려 사항입니다. 하지만 안전성 테스트 결과 Sonnet 4.6의 저항성은 Opus 4.6과 대등한 것으로 나타났습니다. Anthropic은 API 문서에서 완화 가이드를 제공합니다.
벤치마크 및 사용자 체감 성능
| 평가 항목 | 상대적 성능 | 주요 관찰 사항 |
|---|---|---|
| Claude Code (코딩) | Sonnet 4.5 대비 약 70% 더 선호됨; Opus 4.5 대비 59% 더 선호됨 | 더 나은 컨텍스트 읽기, 중복 로직 감소, 환각 감소 |
| OfficeQA (기업 문서 추론) | Opus 4.6과 대등 | 문서 이해 워크로드에 대한 상당한 업그레이드 |
| Vending-Bench Arena (장기 비즈니스 시뮬레이션) | 초기에 집중 투자하고 나중에 수익성으로 전환함으로써 Sonnet 4.5를 능가함 | 다개월 단위의 전략적 계획 능력 입증 |
| OSWorld-Verified (컴퓨터 사용) | Sonnet 모델 중 최고 점수; 파트너 보험 벤치마크에서 평가된 모델 중 최고 (정확도 94%) |
고객 피드백 – 여러 파트너사(Databricks, Replit, Cursor, GitHub, Cognition, Windsurf, Hebbia, Box, Pace, Bolt, Rakuten, Zapier, Convey, Triple Whale, Harvey)에 따르면, Sonnet 4.6은 다음과 같은 점에서 찬사를 받고 있습니다:
- 더욱 세련된 시각적 출력 및 디자인 감각
- 대규모 코드베이스에 걸친 복잡한 코드 수정의 빠른 해결
- 향상된 버그 탐지 및 리뷰 처리량
- 금융 서비스 벤치마크에서의 더 높은 답변 일치율
- 계약 라우팅 및 CRM 조정에서의 강력한 다단계 추론
제품 및 API 개선 사항
- 적응형 및 확장된 사고(Adaptive and extended thinking) 기능이 Claude Platform에서 지원되며, 이전 대화 내용을 자동으로 요약하는 컨텍스트 압축(context compaction) 기능이 베타로 제공됩니다.
- 웹 검색 및 가져오기(Web-search and fetch) 도구는 이제 필터링 코드를 생성하고 실행하여 관련 콘텐츠만 컨텍스트에 유지함으로써 토큰 효율성을 높입니다.
- 도구 세트(Tool suite) – 코드 실행, 메모리, 프로그래밍 방식의 도구 호출, 도구 검색 및 도구 사용 예시를 일반적으로 사용할 수 있습니다.
- Claude in Excel – MCP 커넥터를 통해 스프레드시트를 떠나지 않고도 S&P Global, LSEG, PitchBook, Moody’s, FactSet 등으로부터 원활하게 데이터를 가져올 수 있습니다.
가용성 및 마이그레이션
Claude Sonnet 4.6은 모든 Claude 플랜, Claude Cowork, Claude Code, API 및 주요 클라우드 플랫폼에서 즉시 사용할 수 있습니다. 무료 티어는 이제 Sonnet 4.6을 기본으로 하며 파일 생성, 커넥터, 스킬 및 컨텍스트 압축 기능을 포함합니다. 개발자는 Claude API에서 claude-sonnet-4-6 식별자를 통해 모델을 사용하기 시작할 수 있습니다.
사용자 및 시장에 미치는 영향
- 비용 효율적인 프론티어 성능 – Sonnet 4.6은 더 낮은 Sonnet 가격대로 Opus에 근접한 추론 품질을 제공하여, 고사양 AI 워크로드의 실행 가능한 유스케이스를 확장합니다.
- 더 넓은 자동화 – 성숙해진 컴퓨터 사용 능력은 커스텀 커넥터의 필요성을 줄여 AI가 UI를 통해 레거시 소프트웨어와 상호작용할 수 있게 합니다.
- 긴 컨텍스트 추론 – 1M-토큰 윈도우는 이전에는 불가능했던 전체 문서 분석, 광범위한 코드베이스 쿼리 및 다단계 계획의 가능성을 엽니다.
- 안전성 태세 – 안전성 테스트 및 프롬프트 인젝션 완화에 대한 지속적인 강조은 책임감 있는 AI 제공자로서 Anthropic의 입지를 강화합니다.
관련 발표
- Fable 5의 생물학적 안전장치 개선 – 자세한 내용은 Anthropic 블로그를 참조하십시오.
- Mariano-Florentino (Tino) Cuéllar, Anthropic의 최고 글로벌 업무 책임자(Chief Global Affairs Officer)로 합류 – 기업 리더십 업데이트.
Sources
- OriginalIntroducing Sonnet 4.6
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch