Claude 4 release notes / what's new

Anthropic은 차세대 Claude 모델인 Claude Opus 4Claude Sonnet 4를 출시했습니다. 이 모델들은 코딩, 고급 추론 및 AI 에이전트 분야에서 새로운 벤치마크를 설정하며, 사용자가 즉각적인 응답과 심층 추론을 위한 확장된 사고(extended thinking) 사이를 전환할 수 있는 하이브리드 모드를 도입했습니다.

Model Performance and Benchmarks

Claude Opus 4와 Claude Sonnet 4는 소프트웨어 엔지니어링 및 추론 작업에서 업계 최고 수준을 선도하고 있습니다. Opus 4는 세계 최고의 코딩 모델로 자리매김하고 있으며, Sonnet 4는 성능과 효율성의 균형을 제공합니다.

Coding and Software Engineering

  • SWE-bench: Claude Opus 4는 72.5%를, Claude Sonnet 4는 72.7%의 pass@1을 달성했습니다.
  • Terminal-bench: Claude Opus 4는 43.2%를 기록하며 다른 모델들을 크게 앞지르고 있습니다.
  • Agentic Terminal Coding: Claude Code를 에이전트 프레임워크로 사용할 때, Opus 4는 43.2%, Sonnet 4는 35.5%에 도달합니다.

Reasoning and Knowledge

  • GPQA Diamond: Opus 4는 79.6%를 기록했습니다 (parallel test-time compute 사용 시 83.3%).
  • AIME 2025: Opus 4는 75.5%를 달성했습니다 (parallel test-time compute 사용 시 90.0%로 증가).
  • MMMLU: Opus 4는 88.8%, Sonnet 4는 86.5%를 기록했습니다.
  • MMMU (Validation): Opus 4는 76.5%, Sonnet 4는 74.4%를 기록했습니다.

Key Technical Capabilities

Claude 4는 AI 에이전트의 자율성과 신뢰성을 높이기 위해 설계된 여러 구조적 및 기능적 개선 사항을 도입했습니다.

Extended Thinking and Tool Use

두 모델 모두 이제 **extended thinking with tool use (beta)**를 지원합니다. 이를 통해 모델은 내부 추론과 웹 검색과 같은 도구 실행 사이를 교차하며 응답을 정교화할 수 있습니다. 또한, 모델은 이제 도구를 병렬로 실행할 수 있습니다.

Memory and Continuity

Claude Opus 4는 현저히 향상된 메모리 능력을 보여줍니다. 개발자가 로컬 파일에 대한 접근 권한을 부여하면, 모델은 핵심 사실을 추출하고 저장하기 위한 "memory files"를 생성하고 유지할 수 있습니다. 이를 통해 모델은 암묵적 지식을 구축하고 장기적인 작업에 대해 연속성을 유지할 수 있습니다.

Reliability and Precision

Anthropic은 모델이 작업을 완료하기 위해 지름길이나 편법을 사용하는 경향을을 줄였습니다. Opus 4와 Sonnet 4 모두 Sonnet 3.7과 비교했을 때 에이전트 작업에서 이러한 행동을 보일 확률이 65% 감소했습니다.

Thinking Summaries

길고 긴 사고 과정을 관리하기 위해, Claude 4 모델은 더 작은 모델을 사용하여 사고 요약본(thinking summaries)을 압축합니다. 이는 사고 과정이 너무 길어 전체를 표시하기에 부적절한 경우 약 5%의 사례에서 적용됩니다.

Claude Code and Developer Ecosystem

Claude Code가 이제 정식 출시(generally available)되어, 터미널과 IDE에서 AI와 협업할 수 있는 개발자의 능력을 확장합니다.

  • IDE Integration: VS Code와 JetBrains를 위한 새로운 beta extensions이 도입되어, 제안된 수정 사항이 파일 내에 인라인으로 표시됩니다.
  • Claude Code SDK: 확장 가능한 SDK를 통해 개발자가 커스텀 에이전트를 구축할 수 있습니다. GitHub를 위한 beta integration이 제공되어 Claude Code가 PR feedback을 처리하고, CI errors를 수정하고, 태깅을 통해 코드를 수정할 수 있습니다.
  • API Enhancements: 네 가지 새로운 API 기능이 출시되었습니다: code execution tool, MCP connector, Files API, 그리고 최대 1시간 동안의 prompt caching.

Industry Adoption and Feedback

여러 프론티어 AI 기업 및 플랫폼이 Claude 4를 통합했습니다:

  • GitHub: GitHub Copilot의 새로운 코딩 에이전트의 엔진으로 Claude Sonnet 4를 도입할 예정입니다.
  • Cursor: Opus 4를 복잡한 코드베이스 이해에 있어 비약적인 도약이라고 설명합니다.
  • Replit: 여러 파일에 걸친 복잡한 변경 사항에 대한 정밀도가 향상되었다고 보고합니다.
  • Block: Opus 4가 에이전트 codename goose의 편집 및 디버깅 과정에서 코드 품질을을umentation의 첫 번째 모델이라고 언급합니다.
  • Rakuten: Opus 4가 7시간 동안 독립적으로 오픈소스 리팩토링을 수행할 수 있는 능력을 검별증명했습니다.
  • Cognition: Opus 4가 이전 모델들이 놓쳤던 복잡한 과제를 해결하는 데 탁월하다고 명언합니다.

Availability and Pricing

Claude Opus 4와 Sonnet 4는 Claude.ai 인터페이스, Amazon Bedrock, Google Cloud Vertex AI를 통해 이용할 수 있습니다.

  • Pricing:
    • Opus 4: $15 per million input tokens / $75 per million output tokens.
    • Sonnet 4: $3 per million input tokens / $15 per million output tokens.
    • Sonnet 4: $3 per million input tokens / $15 per million output tokens.
  • Access: Pro, Max, Team, and Enterprise plans include both models. Sonnet 4는 free users도 이용할 수 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch