Claude Sonnet 5.5 릴리스 노트

Claude Sonnet 5.5는 속도, 비용, 에이전트형 코딩 성능에서 큰 향상을 제공합니다

Claude Sonnet 5.5는 일상적인 작업, 버그 수정, 문서 작성에 적합한 고성능 모델입니다. 이전 버전인 Sonnet 5보다 30% 빠르고, 작업당 최대 30% 저렴하며, 특히 코딩과 전문 지식 작업에서 에이전트 기능이 크게 향상되었습니다.

성능 벤치마크 및 기능

Sonnet 5.5는 여러 핵심 평가에서 Sonnet 5에 비해 극적인 향상을 보이며, 일부 성능 수준은 더 강력한 Claude Opus 5.5에 근접합니다.

에이전트형 코딩 및 컴퓨터 사용

Sonnet 5.5는 에이전트형 코딩에서 큰 도약을 보였으며, Terminal-Bench 4.0에서 Sonnet 5의 10.3% 대비 70.6%를 기록했습니다. OSWorld 2.1(80.1% 부분 점수) 및 CursorBench 4.0(55.5%)에서도 강력한 성능을 보여, 후자의 경우 Opus 5.5와 두 점 내외로 격차를 좁혔습니다.

지식 작업 및 추론

GDPval-AA 벤치마크(44개 직업에 걸친 실제 작업 테스트)에서 Sonnet 5.5는 1844점을 기록해 Opus 5.5(1846점)에 거의 근접하며, Sonnet 5(1449점)를 크게 상회했습니다. 또한 장기적 지식 작업과 시각적 차트 인식에서 GPT-6 Sol을 능가했으며(Chartography에서 61.6%), 장기적 작업에서도 뛰어난 성능을 보였습니다.

비교 표

벤치마크 Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ —
FrontierCode 1.1 (Main) 46.2% (Max)² 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% —
GDPval-AA v2.1 1844 1449 1846 1487⁴
Humanity's Last Exam 64.5% (도구 사용) 54.9% (도구 사용) 67.7% (도구 사용) —
OSWorld 2.1 80.1% (부분) 57.0% (부분) 81.8% (부분) —
Chartography 61.6% (도구 미사용) 15.6% (도구 미사용) 64.4% (도구 미사용) 53.6%⁴

¹ 참고: Terminal-Bench에서의 격차는 Opus 5.5의 보안 후속 조치 발생률(10%)이 Sonnet 5.5(1.5%)보다 높기 때문입니다.

비용 및 속도 효율성

Sonnet 5.5는 Sonnet 5와 동일한 토큰당 가격을 유지하면서, 동일한 결과를 얻기 위해 더 적은 토큰을 사용함으로써 작업당 총 비용을 줄였습니다.

가격 구조

100만 토큰당 가격 Claude Sonnet 5.5 Claude Opus 5.5
캐시 읽기 $0.20 $0.20
캐시 쓰기 $2.50 $5
입력 토큰 $2 $4
출력 토큰 $10 $20

효율성 향상

  • 속도: Sonnet 5보다 30% 이상 빠르게 출력을 생성합니다.
  • 작업 비용: 토큰 효율성이 향상되어 Sonnet 5보다 작업당 최대 30% 저렴합니다.
  • 노력 수준: 사용자는 속도와 비용, 품질 간 균형을 위해 노력 수준(Low, Medium, High, Xhigh, Max)을 조정할 수 있습니다. Claude 앱의 기본값은 Medium입니다.

안전성, 일치성 및 보호 조치

Sonnet 5.5는 능력이 향상됨에 따라 고도화된 보호 조치를 도입했으며, 특히 사이버 보안 분야에서 강화되었습니다.

  • 사이버 보안: Opus 5.5와 유사한 능력을 갖추게 되면서, Sonnet 5.5는 처음으로 사이버 보호 조치를 갖춘 Sonnet 모델로 출시되었습니다. 고위험 요청은 Sonnet 5로 후속 처리됩니다.
  • 정제 방지: 산업 규모의 공격을 통한 모델 능력 추출을 방지하기 위해, Sonnet 5.5는 추론 추출을 방지하는 안전성 분류기와 함께 '보존된 사고' 영역을 확장했습니다.
  • 일치성: 자동화된 행동 감사 결과, Sonnet 5.5는 솔직함, 오용에 대한 저항력, 일치성 면에서 Sonnet 5와 동일하거나 향상된 성능을 보였습니다.

커뮤니티 인사이트 및 반론

공식 벤치마크는 강력하지만, Hacker News의 커뮤니티 피드백은 몇 가지 실용적인 우려와 관찰을 제기했습니다:

  • Opus 대비 가치 제안: 일부 사용자는 높은 노력 수준에서 Sonnet 5.5의 실용성에 의문을 제기하며, Opus 5.5가 유사하거나 더 낮은 작업당 비용으로 더 높은 정확도를 제공하는 경우가 많다고 지적했습니다.
  • 사고 토큰 한계: 일부 사용자는 "Max" 노력 수준에서 모델이 128,000 토큰의 사고 토큰 한계를 소진해도 최종 응답을 생성하지 못하는 경우를 보고했습니다.
  • 보호 조치의 부작용: 사이버 검증 프로그램 사용자들은 보호 조치가 지나치게 강경해, 허가된 보너스 작업까지 Cyber 위반으로 판단하는 경우가 있다고 보고했습니다.
  • 성능 저하: 일부 사용자는 특정 특수 분야(예: 고도로 전문화된 프로그래밍 언어)에서 Sonnet 5.5가 Sonnet 5보다 더 끈기 있게 작업을 수행하지 않는다는 점을 지적하며 성능 저하를 보고했습니다.
  • 경쟁 환경: 댓글 작성자들은 Sonnet 5.5가 Sonnet 5에 비해 큰 도약을 이루었지만, DeepSeek 또는 OpenAI의 Luna와 같은 경쟁 모델보다 여전히 훨씬 비싸다고 지적했습니다.

"에픽의 초기 테스트에서, Claude Sonnet 5.5는 더 높은 등급의 모델이 기대하는 품질 기준을 충족했습니다... 새로운 모델은 게임플레이 시스템 아키텍처를 위한 수만 줄의 코드를 처리했으며, 응답은 빠르고, 수시간에 걸친 작업도 처리했으며, 더 많은 지시 없이도 효과적으로 결과를 도출했습니다." — Daniel Vogel, COO, 에픽 게임즈

Sources

관련