Claude Opus 4.8 릴리스 노트

Anthropic은 코딩, 추론 및 실무 지식 작업 전반의 벤치마크를 개선한 Opus 4.7의 업그레이드 버전인 Claude Opus 4.8을 출시했습니다. 이번 업데이트는 에이전트 작업에 대해 더 신뢰할 수 있는 협업자를 도입하며, 이전 모델과 동일한 가격으로 즉시 사용할 수 있습니다.

향상된 모델 능력 및 신뢰성

Claude Opus 4.8은 특히 에이전트 및 자율 워크플로우에서 향상된 판단력과 신뢰성을 보여줍니다. 초기 테스터와 내부 평가에 따르면, 이 모델은 자신의 실수를 스스로 포착하고 불확실성을 선제적으로 알리는 데 더 효과적입니다.

주요 성능 향상

  • Honesty and Accuracy: Opus 4.8은 Opus 4.7에 비해 자신이 작성한 코드의 결함을 인지하지 못하고 넘어갈 확률이 약 4배 더 낮습니다.
  • Agentic Performance: 이 모델은 Super-Agent 벤치마크에서 모든 케이스를 엔드투엔드로 완료한 유일한 모델로 보고되었으며, 비용 효율성 측면에서 이전 Opus 모델과 GPT-5.5를 능가합니다.
  • Browser and Computer Use: Opus 4.8은 Online-Mind2Web에서 84%를 기록하며 Opus 4.7과 GPT-5.5를 모두 능가했습니다.
  • Legal and Professional Work: 이 모델은 Legal Agent Benchmark에서 역대 최고 점수를 기록하며, all-pass 표준을 10% 이상 초과한 첫 번째 모델이 되었습니다.

업계 피드백

업계 파트너들은 다음과 같은 구체적인 운영 개선 사항을 강조했습니다:

  • Databricks: Genie AI 에이전트를 위한 "에이전트 추론의 단계적 변화"를 보고했으며, 비정형 콘텐츠에 대한 멀티모달 추론 비용이 Opus 4.7보다 토큰 비용 측면에서 61% 더 저렴해졌습니다.
  • Devin: Opus 4.8이 Opus 4.7에서 발견된 주석의 장황함과 도구 호출(tool-calling) 문제를 해결하여, 더 일관성 있는 무인 자율 엔지니어링을 가능하게 한다고 언급했습니다.
  • Hebbia: 금융 문서 워크플로우를 위한 검색 시 인용 정확도 향상 및 토큰 효율성 개선을 관찰했습니다.
  • Cursor: 도구 호출이 더 효율적으로 변하여 동일한 수준의 지능을 위해 필요한 단계가 줄어들었다고 보고했습니다.

새로운 기능 및 도구

모델 출시와 함께 Anthropic은 사용자가 모델 동작 및 규모를 더 잘 제어할 수 있도록 하는 여러 기능을 도입했습니다.

Claude Code의 동적 워크플로우

Enterprise, Team, Max 플랜의 연구용 프리뷰(research preview)로 제공되는 동적 워크플로우는 Claude가 작업을 계획하고 단일 세션에서 수백 개의 병렬 서브에이전트를 실행함으로써 대규모 문제를 관리할 수 있게 합니다. 이를 통해 시작부터 병합(merge)까지 수십만 줄의 코드베이스 규모의 마이그레이션을 수행할 수 있습니다.

노력 제어(Effort Control)

claude.ai 및 Cowork의 사용자는 이제 Claude가 응답답에 들이는 노력의 양을 선택할 수 있습니다:

  • High Effort (Default): 품질과 사용자 경험의 균형을 맞춘 모드드; 코딩 작업에서 Opus 4.7의 기본 설정보다 성능이 더 뛰어나며 유사한 토큰을 사용합니다.
  • Extra/Max Effort: 모델이 더 나은 결과를 얻기 위해 더 많은 토큰을 사용합니다. 어려운 과제나 장-기간의 비동기식 워크플로우에 권장됩니다.
  • Low Effort: 더 빠른 응답을 제공하며 속도 제한(rate limits)을 더 천천히 소모합니다.

Messages API 업데이트

Messages API는 이제 messages array 내부에 system entries를 지원합니다. 이를 통해 개발자는 프롬프트 캐시를 깨뜨리거나 사용자 턴(user turn)을 요구하지 않고도 작업 중간에 지침, 권한, 토큰 예산 또는 환경 컨텍스트를 업데이트할 수 있습니다.

정렬(Alignment) 및 안전성

Opus 4.8은 상세한 정렬 평가를를 거쳤습니다. Anthropic 정렬 팀은 이 모델이 친사회적 특성, 특히 사용자의 자율성을 지원하고 사용자의 최선의 이익을 위해 행동하는 측면에서 "새로운 고점"을 달성성했습니다. 기만이나 오용에 대한 협력과 같은 미정렬 행동(misaligned behavior)의 비율은 Opus 4.7보다 실질적으로 낮으며, Claude Mythos Preview 모델과 유사한 수준입니다.

가격 및 가용성

Claude Opus 4.8은 Claude API (claude-opus-4-8) 및 claude.ai를 통해 사용할 수 있습니다.

Mode Input Price (per M tokens) Output Price (per M tokens)
Regular $5 $25
Fast Mode (2.5x speed) $10 $50

Fast mode for Opus 4.8의 경우 이전 모델의 fast mode보다 3배 더 저렴합니다.

향후 로드맵

Anthropic은 두 가지 주요 방향으로 작업하고 있습니다: 더 낮은 비용으로 Opus-level 능력을 개발하는 것과 더 높은 지능을 가진 새로운 클래스의 모델을 모델을 만드는 것입니다. Project Glasswing의 일환으로, 회사는 현재 사이버 보안 작업을 위한 Claude Mythos Preview를 테스트 중이며, 필요한 사이버 보안 안전장치를 구현한 후 몇 주 내에 Mythos-class 모델을 모든 고객에게 제공할 것으로 예상합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch