Claude Opus 4.6 릴리스 노트
Anthropic은 에이전트 기반 코딩, 장기 계획 수립 및 복잡한 다학제적 추론을 강화하기 위해 설계된 가장 스마트한 모델의 중대한 업그레이드인 Claude Opus 4.6을 출시했습니다. 이번 업데이트는 베타 버전으로 1M 토큰 컨텍스트 윈도우를 도입하며, 새로운 노력(effort) 설정을 통해 개발자에게 모델의 추론 깊이와 비용에 대한 세밀한 제어 권한을 제공합니다.
최첨단 성능 및 벤치마크
Claude Opus 4.6은 여러 고복잡도 평가에서 업계를 선도하며, 지식 작업 및 에이전트 작업에서 탁월한 능력을 입증했습니다:
- Agentic Coding: Terminal-Bench 2.0 평가에서 가장 높은 점수를 기록했습니다.
- Multidisciplinary Reasoning: Humanity’s Last Exam에서 다른 모든 프론티어 모델들을 앞서고 있습니다.
- Knowledge Work: 금융 및 법률 도메인의 성능을 평가하는 GDPval-AA에서 Opus 4.6은 OpenAI의 GPT-5.2보다 약 144 Elo 포인트, 이전 모델인 Claude Opus 4.5보다 190포인트 더 높은 성능을 보여줍니다.
- Information Retrieval: 찾기 어려운 온라인 정보를 찾아내는 능력을 측정하는 BrowseComp에서 다른 모든 모델보다 뛰어난 성능을 보입니다.
긴 컨텍스트 능력 및 "Context Rot"
Opus 4.6은 "context rot"(긴 대화에서 성능이 저하되는 현상) 문제를 해결합니다. MRCR v2 needle-in-a-haystack 벤치마크의 8-needle 1M 변형에서 Opus 4.6은 76%를 기록하여, Sonnet 4.5의 18.5%보다 훨씬 높은 점수를 받았습니다. 이를 통해 모델은 수십만 개의 토큰에 걸쳐 최소한의 편차로 정보를 추적하고 매몰된 세부 정보를 더 효과적으로 검색할 수 있습니다.
개발자를 위한 기술적 향상
Anthropic은 개발자가 장기 실행 에이전트를 구현하고 비용을 관리하는 방식을 최적화하기 위해 Claude Platform에 몇 가지 새로운 기능을 도입했습니다:
적응형 사고 및 노력 제어
개발자는 이제 low, medium, high (기본값), max의 네 가지 노력 수준을 사용하여 지능, 속도 및 비용 사이의 균형을 관리할 수 있습니다.
또한, adaptive thinking을 통해 모델이 이진 온/오프 토글 대신 문맥적 단서를 기반으로 확장된 사고를 사용할 시점을 자율적으로 결정할 수 있습니다.
컨텍스트 관리 및 출력
- Context Compaction (Beta): 에이전트가 긴 작업 중에 컨텍스트 윈도우 제한에 도달하는 것을 방지하기 위해, 이 기능은 구성 가능한 임계값에 도달하면 오래된 컨텍스트를 자동으로 요약하고 교체합니다.
- 1M Token Context (Beta): 이는 1M 토큰 윈도우를 지원하는 최초의 Opus급 모델입니다. 200k 토큰을 초과하는 프롬프트에는 프리미엄 가격이 적용됩니다 ($1M 입력/출력 토큰당 $10/$37.50).
- 128k Output Tokens: 이제 모델은 최대 128k 토큰의 출력을 생성할 수 있어, 대규모 작업을 여러 요청으로 분할할 필요가 줄어들었습니다.
제품 통합 및 에이전트 워크플로우
Opus 4.6은 더 자율적인 작업을 가능하게 하기 위해 여러 생산성 도구에 통합되었습니다:
- Claude Code: 이제 연구 프리뷰 단계에서 "agent teams" 기능을 제공하여, 여러 에이전트가 병렬로 작업하고 코드베이스 리뷰와 같은 작업에서 자율적으로 협업할 수 있습니다.
- Office Integration: Excel의 Claude는 다단계 변경 및 비정형 데이터 수집을 처리할 수 있도록 업그레이드되었습니다. PowerPoint의 Claude는 현재 Max, Team, Enterprise 플랜을 위한 연구 프리뷰 단계에 있으며, 레이아웃, 글꼴 및 슬라이드 마스터를 기반으로 데크를 생성할 수 있습니다.
- Cowork: Opus 4.6은 Cowork 연구 프리뷰를 구동하여 연구, 재무 분석 및 문서 생성 전반에 걸친 자율적인 멀티태스킹을 가능하게 합니다.
안전성 및 정렬
시스템 카드에 따르면, Opus 4.6은 다른 프론티어 모델과 대등하거나 그 이상의 안전 프로필을 유지합니다. 기만 및 아첨을 포함한 정렬되지 않은 행동의 비율이 낮으며, 최근 Claude 모델 중 과도한 거부(over-refusals) 비율이 가장 낮습니다.
모델의 강화된 사이버 보안 능력과 관련된 위험을 완화하기 위해, Anthropic은 유해한 응답을 감지하기 위한 6가지 새로운 사이버 보안 프로브를 구현했으며, 오픈 소스 소프트웨어의 취약점 패치와 같은 사이버 방어적 용도로 모델의 응용 분야를 집중시키고 있습니다.
Sources
- OriginalClaude Opus 4.6
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch