Claude Opus 5 출시 노트
Anthropic는 높은 효율성의 일상적 사용을 위한 모델인 Claude Opus 5를 출시했습니다. 이 모델은 작업당 비용의 절반으로 Claude Fable 5에 근접한 최첨단 지능을 제공하며, 이제 Claude Max의 기본 모델이자 Claude Pro에서 사용 가능한 가장 강력한 모델입니다.
코딩 및 지식 작업 분야에서 최첨단 성능
Claude Opus 5는 소프트웨어 공학 및 문제 해결 분야의 여러 주요 평가에서 새로운 최고 기록을 수립하며, 일반적으로 이전 모델과 경쟁 모델을 능가하면서도 더 낮은 비용으로 성능을 발휘합니다.
소프트웨어 공학 벤치마크
- Frontier-Bench v0.1: Opus 5는 모든 다른 모델을 능가하며 Opus 4.8의 성능을 두 배 이상 상회하면서 작업당 비용을 감소시켰습니다.
- CursorBench 3.2: 최대 노력 수준에서 Opus 5는 작업당 비용의 절반으로 Fable 5의 최고 점수에 0.5% 내외로 근접했습니다. 주어진 비용에서 고, xhigh, 최대 노력 수준에서 모든 다른 모델을 능가했습니다.
- OSWorld 2.0: Opus 5는 주어진 비용에서 모든 다른 모델을 능가하며, Fable 5의 최고 성과를 약 1/3의 비용으로 초과했습니다.
지식 작업 및 문제 해결
- ARC-AGI 3: Opus 5는 이 새로운 문제 해결 평가에서 다음으로 좋은 모델보다 점수가 3배 높았습니다.
- Zapier AutomationBench: Opus 5는 작업당 비용이 동일할 때 다음으로 좋은 모델보다 약 1.5배 높은 통과율을 기록했습니다. 가장 낮은 노력 수준에서도 다른 모든 모델보다 더 많은 작업을 통과했습니다.
- Frontier-Bench 및 GDPval-AA: Opus 5는 이 코딩 및 지식 작업 평가에서 새로운 최고 기록을 수립했습니다.
과학 연구 및 시각적 능력 향상
Opus 5는 생명과학 분야에서 특히 두드러진 과학 연구 능력 향상과 함께 향상된 시각적 출력 기능을 도입했습니다.
생명과학 분야 개선
Opus 5는 생물정보학, 구조 생물학, 유기 화학을 포함한 모든 생명과학 평가에서 Opus 4.8를 능가했습니다. 주요 성과는 다음과 같습니다:
- 유기 화학: 스펙트로스코피 데이터에서 분자 구조를 추론하는 데 있어 Opus 4.8보다 10.2%포인트 향상되었습니다.
- 단백질 연구: 단백질 서열 변이가 기능에 미치는 영향을 예측하는 데 있어 7.7%포인트 향상되었습니다.
능동적 행동 및 실용적 적용
Claude Opus 5는 더 높은 능동성, 철저함, 반복을 통해 스스로의 작업을 검증할 수 있는 능력을 보여줍니다.
기술적 사례 연구
- 자율 도구 사용: Frontier-Bench 작업에서 Opus 5는 직접 시각화 기능을 거부당했을 때, 원시 픽셀에서 기하학적 정보를 추출해 3D FreeCAD 모델을 재구성하기 위한 자체 컴퓨터 비전 파이프라인을 작성했습니다.
- 버그 해결: Opus 5는 인기 있는 오픈소스 패키지 매니저에서 실제 버그의 근본 원인을 식별하고, 이전 커뮤니티 패치가 놓친 엣지 케이스를 수정했습니다.
- 인프라 개발: 거래 회사의 엔지니어는 Opus 5를 사용해 단일 세션 내에 시장 데이터 피드를 구축했으며, 검증을 위한 자체 테스트 허브도 생성했습니다.
산업계 피드백
초기 접근 파트너들은 특정 강점을 강조했습니다:
- Devin: 어려운 디버깅 및 근본 원인 분석에서 뛰어난 성능을 보였습니다.
- Lovable: 가장 어려운 능동적 코딩 작업에서 Opus 4.7보다 22% 향상되었으며, 변동성이 낮았습니다.
- Box: Opus 4.8보다 전반적으로 8% 성능 향상되었으며, 데이터 분석에서는 11%, 준수 검토 워크플로우에서는 17% 향상되었습니다.
- 법률 에이전트: 최대 추론 수준과 유사한 성능을 보였지만, Opus 4.8보다 26% 적은 토큰을 생성했습니다.
일치성, 안전성 및 사이버 보안
Opus 5는 Anthropic가 현재까지 출시한 모델 중 가장 일치성이 높으며, Opus 4.8, Sonnet 5, Fable 5보다 Claude의 헌법을 더 엄격히 따릅니다.
행동 감사 및 리스크 완화
- 일치성 점수: 자동화된 행동 감사에서 Opus 5는 전반적인 일치하지 않는 행동에 대해 2.3점(최근 모델 중 가장 낮음)을 기록했습니다.
- 사이버 보안 한계: Opus 5는 취약점을 식별하는 데 Mythos 5에 근접했지만, 취약점 악용(예: OSS-Fuzz 벤치마크에서 확인됨)에서는 여전히 Mythos 5에 크게 뒤처졌습니다.
- 생물학 연구: Opus 5는 일반적으로 이용 가능한 모델 중 과학 연구 능력이 가장 뛰어나지만, 장기간 자율 연구 작업에서는 여전히 Mythos 5에 뒤져 있습니다.
안전 장치 및 분류기
- 사이버 분류기: Fable 5보다 더 제한적이지 않으며, 소스 코드 내 취약점 탐지에는 허용하지만 바이너리 기반 스캔, 침투 테스트, 악용 생성은 차단합니다. 이 분류기는 Fable 5의 것보다 약 85% 적게 개입할 것으로 예상됩니다.
- 백업 기능: Opus 5 또는 Fable 5의 안전 분류기로 표시된 요청은 이제 API를 통해 다른 모델로 자동 라우팅될 수 있습니다.
가격 및 이용 가능 여부
Claude Opus 5는 다음 가격으로 모든 플랫폼에서 이용 가능합니다:
- 입력 토큰: 100만 토큰당 $5
- 출력 토큰: 100만 토큰당 $25
- 빠른 모드: 기본 가격의 두 배이며, 기본 속도의 약 2.5배 속도 제공
베타 기능 출시
- 대화 중 도구 변경: 개발자는 대화 중에 사용 가능한 도구를 변경할 수 있으며, 프롬프트 캐시를 무효화하지 않아도 됩니다.
- 자동 백업: API 사용자는 표시된 요청을 다른 모델로 라우팅하여 차단되는 것을 방지할 수 있습니다.
Sources
- OriginalIntroducing Claude Opus 5
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch