Claude Sonnet 5.5 릴리스 노트
Claude Sonnet 5.5는 속도, 비용, 에이전트형 코딩 성능에서 큰 향상을 제공합니다
Claude Sonnet 5.5는 일상적인 작업, 버그 수정, 문서 작성에 적합한 고성능 모델입니다. 이전 버전인 Sonnet 5보다 30% 빠르고, 작업당 최대 30% 저렴하며, 특히 코딩과 전문 지식 작업에서 에이전트 기능이 크게 향상되었습니다.
성능 벤치마크 및 기능
Sonnet 5.5는 여러 핵심 평가에서 Sonnet 5에 비해 극적인 향상을 보이며, 일부 성능 수준은 더 강력한 Claude Opus 5.5에 근접합니다.
에이전트형 코딩 및 컴퓨터 사용
Sonnet 5.5는 에이전트형 코딩에서 큰 도약을 보였으며, Terminal-Bench 4.0에서 Sonnet 5의 10.3% 대비 70.6%를 기록했습니다. OSWorld 2.1(80.1% 부분 점수) 및 CursorBench 4.0(55.5%)에서도 강력한 성능을 보여, 후자의 경우 Opus 5.5와 두 점 내외로 격차를 좁혔습니다.
지식 작업 및 추론
GDPval-AA 벤치마크(44개 직업에 걸친 실제 작업 테스트)에서 Sonnet 5.5는 1844점을 기록해 Opus 5.5(1846점)에 거의 근접하며, Sonnet 5(1449점)를 크게 상회했습니다. 또한 장기적 지식 작업과 시각적 차트 인식에서 GPT-6 Sol을 능가했으며(Chartography에서 61.6%), 장기적 작업에서도 뛰어난 성능을 보였습니다.
비교 표
| 벤치마크 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | — |
| FrontierCode 1.1 (Main) | 46.2% (Max)² | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487⁴ |
| Humanity's Last Exam | 64.5% (도구 사용) | 54.9% (도구 사용) | 67.7% (도구 사용) | — |
| OSWorld 2.1 | 80.1% (부분) | 57.0% (부분) | 81.8% (부분) | — |
| Chartography | 61.6% (도구 미사용) | 15.6% (도구 미사용) | 64.4% (도구 미사용) | 53.6%⁴ |
¹ 참고: Terminal-Bench에서의 격차는 Opus 5.5의 보안 후속 조치 발생률(10%)이 Sonnet 5.5(1.5%)보다 높기 때문입니다.
비용 및 속도 효율성
Sonnet 5.5는 Sonnet 5와 동일한 토큰당 가격을 유지하면서, 동일한 결과를 얻기 위해 더 적은 토큰을 사용함으로써 작업당 총 비용을 줄였습니다.
가격 구조
| 100만 토큰당 가격 | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| 캐시 읽기 | $0.20 | $0.20 |
| 캐시 쓰기 | $2.50 | $5 |
| 입력 토큰 | $2 | $4 |
| 출력 토큰 | $10 | $20 |
효율성 향상
- 속도: Sonnet 5보다 30% 이상 빠르게 출력을 생성합니다.
- 작업 비용: 토큰 효율성이 향상되어 Sonnet 5보다 작업당 최대 30% 저렴합니다.
- 노력 수준: 사용자는 속도와 비용, 품질 간 균형을 위해 노력 수준(Low, Medium, High, Xhigh, Max)을 조정할 수 있습니다. Claude 앱의 기본값은 Medium입니다.
안전성, 일치성 및 보호 조치
Sonnet 5.5는 능력이 향상됨에 따라 고도화된 보호 조치를 도입했으며, 특히 사이버 보안 분야에서 강화되었습니다.
- 사이버 보안: Opus 5.5와 유사한 능력을 갖추게 되면서, Sonnet 5.5는 처음으로 사이버 보호 조치를 갖춘 Sonnet 모델로 출시되었습니다. 고위험 요청은 Sonnet 5로 후속 처리됩니다.
- 정제 방지: 산업 규모의 공격을 통한 모델 능력 추출을 방지하기 위해, Sonnet 5.5는 추론 추출을 방지하는 안전성 분류기와 함께 '보존된 사고' 영역을 확장했습니다.
- 일치성: 자동화된 행동 감사 결과, Sonnet 5.5는 솔직함, 오용에 대한 저항력, 일치성 면에서 Sonnet 5와 동일하거나 향상된 성능을 보였습니다.
커뮤니티 인사이트 및 반론
공식 벤치마크는 강력하지만, Hacker News의 커뮤니티 피드백은 몇 가지 실용적인 우려와 관찰을 제기했습니다:
- Opus 대비 가치 제안: 일부 사용자는 높은 노력 수준에서 Sonnet 5.5의 실용성에 의문을 제기하며, Opus 5.5가 유사하거나 더 낮은 작업당 비용으로 더 높은 정확도를 제공하는 경우가 많다고 지적했습니다.
- 사고 토큰 한계: 일부 사용자는 "Max" 노력 수준에서 모델이 128,000 토큰의 사고 토큰 한계를 소진해도 최종 응답을 생성하지 못하는 경우를 보고했습니다.
- 보호 조치의 부작용: 사이버 검증 프로그램 사용자들은 보호 조치가 지나치게 강경해, 허가된 보너스 작업까지
Cyber위반으로 판단하는 경우가 있다고 보고했습니다. - 성능 저하: 일부 사용자는 특정 특수 분야(예: 고도로 전문화된 프로그래밍 언어)에서 Sonnet 5.5가 Sonnet 5보다 더 끈기 있게 작업을 수행하지 않는다는 점을 지적하며 성능 저하를 보고했습니다.
- 경쟁 환경: 댓글 작성자들은 Sonnet 5.5가 Sonnet 5에 비해 큰 도약을 이루었지만, DeepSeek 또는 OpenAI의 Luna와 같은 경쟁 모델보다 여전히 훨씬 비싸다고 지적했습니다.
"에픽의 초기 테스트에서, Claude Sonnet 5.5는 더 높은 등급의 모델이 기대하는 품질 기준을 충족했습니다... 새로운 모델은 게임플레이 시스템 아키텍처를 위한 수만 줄의 코드를 처리했으며, 응답은 빠르고, 수시간에 걸친 작업도 처리했으며, 더 많은 지시 없이도 효과적으로 결과를 도출했습니다." — Daniel Vogel, COO, 에픽 게임즈
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch