Claude Opus 4.5 출시: 최첨단 코딩, 에이전트 및 생산성 모델

TL;DR

Claude Opus 4.5는 오늘 Anthropic의 앱, API 및 주요 클라우드 플랫폼에서 출시된 Anthropic의 최신 플래그십 모델입니다. 실제 소프트웨어 엔지니어링 벤치마크, 장기적 자율 작업, 일상적인 생산성(스프레드시트, 슬라이드, 연구)에서 최고의 성능을 발휘하며 토큰 사용량을 크게 줄였고, 가격은 100만 토큰당 5~25달러입니다.


Claude Opus 4.5란?

Claude Opus 4.5는 Anthropic의 Opus 시리즈의 최신 버전입니다. 회사는 이를 지능적이고 효율적이며 코딩, 에이전트, 컴퓨터 사용 분야에서 세계 최고의 모델이라고 설명합니다. 이 모델은 AI가 업무를 보조하는 방식에 대한 더 큰 변화의 예고로 위치지어져 있습니다.

주요 접근성 정보:

  • 모델 식별자: claude-opus-4-5-20251101
  • Claude API, Anthropic의 소비자 앱, 모든 세 가지 주요 클라우드 플랫폼을 통해 접근 가능.
  • 가격: 기본 레이어는 100만 토큰당 5달러, 고용량 레이어는 100만 토큰당 25달러.

기술적 특징

최첨단 소프트웨어 엔지니어링

  • SWE‑bench Verified 벤치마크에서 Opus 4.5는 선도 모델들 중 가장 높은 점수를 기록했습니다(Anthropic의 차트 참조).
  • 내부 테스트 결과 "내부 코딩 벤치마크를 초과하면서 토큰 사용량을 절반으로 줄였다" 고 보고하며, "모든 벤치마크에서 Sonnet 4.5를 능가하며, 더 적은 단계와 더 적은 토큰을 사용한다" 고 밝혔습니다.
  • 구체적인 코딩 강점은 코드 마이그레이션, 리팩토링, 다중 에이전트 조율(예: 세 개의 조율된 에이전트가 두 개의 코드베이스 리팩토링을 완료)입니다.

장기적 자율적 사고 능력

  • 복잡한 워크플로우에서 Terminal Bench 벤치마크에서 Sonnet 4.5보다 15 % 향상을 보였습니다.
  • 30분간의 자율 코딩 세션에서 사망 경로(dead-ends)가 적고, 도구 호출 및 빌드/린트 오류가 50 %~75 % 감소했습니다.
  • 다단계 계획 능력이 뛰어나며, τ2‑bench에서 제약 조건이 있는 항공권 예약 시나리오에 창의적인 해결책을 제시한 사례로 입증되었습니다.

일반적인 생산성 향상

  • 시각 인식, 추론, 수학 능력이 이전 Opus 버전보다 향상되었습니다.
  • 다양한 분야(예: Excel 자동화, 금융 모델링, 3D 시각화)의 벤치마크에서 20 % 정확도 향상, 15 % 효율성 향상, 최대 65 % 토큰 감소를 기록했습니다.
  • 장기적 컨텍스트 스토리텔링: 일관된 구조로 10~15페이지의 장편 장면을 생성할 수 있습니다.

안전성 개선

  • Anthropic의 시스템 카드에 따르면 Opus 4.5는 그들이 출시한 가장 견고하게 정렬된 모델이며, 아마도 전반적인 선도 모델 중 가장 잘 정렬된 모델일 것입니다.
  • Gray Swan에서 제공하는 매우 강력한 인젝션 공격을 사용한 벤치마크 기준으로, 프롬프트 인젝션에 대한 저항력이 경쟁 선도 모델보다 강합니다.
  • "우려되는 행동" 점수(오용에 협조하거나 자발적으로 바람직하지 않은 행동을 하는 정도)는 이전 출시 버전보다 낮습니다.

새로운 개발자 플랫폼 기능

노력 수준 파라미터

  • 개발자는 속도와 능력 사이에서 트레이드오프를 선택할 수 있습니다. 중간 노력 수준에서 Opus 4.5는 Sonnet 4.5의 SWE‑bench 점수를 따라가면서 출력 토큰을 76 % 줄였습니다. 높은 노력 수준에서는 Sonnet 4.5보다 4.3 pp 높은 점수를 기록하면서 48 % 적은 토큰을 사용했습니다.

컨텍스트 압축 및 메모리 도구

  • 내장된 컨텍스트 편집 SDK는 긴 대화에서 토큰 부담을 줄입니다.
  • 메모리 도구는 대화 간 지속적인 상태를 가능하게 하여 에이전트 성능을 향상시킵니다.

고급 도구 사용 및 하위 에이전트 오케스트레이션

  • Opus 4.5는 하위 에이전트 팀을 관리할 수 있어, 최소한의 상호작용으로 복잡한 다중 에이전트 파이프라인을 구현할 수 있습니다.
  • 노력 제어 및 컨텍스트 관리와 결합하여, 심층 연구 평가에서 약 15 pp 향상을 달성했습니다.

Opus 4.5를 활용한 제품 업데이트

  • Claude Code: 계획 모드는 실행 전에 사용자가 편집 가능한 plan.md를 생성합니다. 데스크톱 앱은 버그 수정, 연구, 문서 업데이트를 위한 병렬 로컬/원격 세션 기능을 추가했습니다.
  • Claude 앱: 자동 요약 기능으로 대화 길이 제한이 제거되어 지속적인 장문 대화가 가능합니다.
  • Claude for Chrome: 모든 Max 사용자에게 제공되며, 탭 간 자동화를 가능하게 합니다.
  • Claude for Excel: 베타 기능이 Max, 팀, 엔터프라이즈 사용자에게 확대되었으며, Opus 4.5의 우수한 스프레드시트 추론 능력을 활용합니다.
  • Opus 4.5의 사용 제한이 Max/팀 프리미엄 사용자에게 해제되어, 이전 Sonnet 모델에서 제공되던 토큰 제한과 동일하게 조정되었습니다.

초기 접근 피드백 (고객 인용)

"Opus 모델은 항상 '진정한 최첨단'이었지만 비용이 너무 높아 활용하기 어려웠습니다. Claude Opus 4.5는 이제 대부분의 작업에 사용할 수 있는 가격대에 있습니다." – Anthropic 파트너 로고

"Claude Opus 4.5는 고품질 코드를 생성하며 GitHub Copilot와 같은 고부하 에이전트 워크플로우를 강력하게 지원합니다. 초기 테스트 결과 내부 코딩 벤치마크를 초과하면서 토큰 사용량을 절반으로 줄였습니다." – 고객 사례

"Claude Opus 4.5는 내부 벤치마크에서 Sonnet 4.5와 경쟁 모델을 모두 능가하며, 동일한 문제를 해결하는 데 더 적은 토큰을 사용합니다." – 내부 벤치마크 보고서

"Claude Opus 4.5는 장기적 자율 작업에서 뛰어나며, 복잡한 워크플로우를 더 적은 사망 경로로 처리하고 Terminal Bench에서 15 % 향상된 성능을 보입니다." – 평가 요약

"Claude Opus 4.5를 사용하면 도구 호출 오류와 빌드/린트 오류가 각각 50 %~75 % 감소합니다." – 신뢰성 테스트


AI 생태계에 미치는 영향

  • 생산성의 경계: 토큰 비용의 일부만으로 최첨단 코딩 성능을 제공함으로써, Opus 4.5는 연구 수준 모델과 저렴한 생산 준비형 AI 사이의 격차를 좁히고 있습니다.
  • 에이전트 자율성: 창의적인 대안(예: 객실 업그레이드 기술)을 고안할 수 있는 능력은 더 유연하고 목표 중심적인 에이전트로의 전환을 시사하며, 기회와 정렬 문제를 동시에 제기합니다.
  • 안전성 기준: 강화된 프롬프트 인젝션 저항력은 산업 내에서 견고성의 새로운 기준을 설정했지만, Anthropic는 보상 해킹 행동을 완화하기 위한 지속적인 작업이 필요하다고 언급했습니다.
  • 경제적 영향: 엄격한 2시간 집중형 엔지니어링 시험에서 인간 지원자들을 능가함으로써, AI가 특정 기술 채용 프로세스에서 경쟁 가능한 대안이 될 수 있음을 시사합니다.

더 알아보기

  • Claude Opus 4.5 시스템 카드 – 능력 및 안전성 평가 방법론에 대한 자세한 설명.
  • Claude API 문서 – 모델 식별자, 가격, 노력 제어 사용법.
  • Anthropic 연구 페이지 – 고급 AI의 더 넓은 사회적 영향과 경제적 미래를 탐구하는 프로젝트들.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch