Claude 2 출시 노트
Anthropic은 추론, 코딩, 안전성 측면에서 상당한 개선을 이루었으며, 훨씬 확장된 컨텍스트 창을 특징으로 하는 새로운 모델인 Claude 2의 출시를 발표했습니다. 이번 업데이트를 통해 모델은 수백 페이지의 기술 문서를 처리하고 단일 출력으로 더 긴 문서를 생성할 수 있습니다.
확장된 컨텍스트 및 출력 기능
Claude 2는 프롬프트당 최대 100K 토큰의 입력 용량을 지원합니다. 이 확장된 컨텍스트 창을 통해 모델은 단일 상호작용 내에서 전체 도서나 포괄적인 기술 문서와 같은 광범위한 데이터 세트를 분석할 수 있습니다. 또한, 모델은 이제 이야기, 편지, 메모 등 수천 토큰에 달하는 더 긴 출력을 생성할 수 있습니다.
성능 벤치마크 및 기술적 개선 사항
Claude 2는 이전 모델인 Claude 1.3에 비해 추론, 수학, 코딩 분야에서 측정 가능한 개선을 보여줍니다:
- Legal Reasoning: Claude 2는 변호사 시험(Bar exam)의 객관식 섹션에서 73.0%에서 76.5%로 점수가 상승했습니다.
- Coding: Codex HumanEval Python 코딩 테스트에서 Claude 2는 56.0%에서 71.2%로 점수가 상승했습니다.
- Mathematics: GSM8k 초등학교 수학 문제 세트에서 모델은 Claude 1.3의 85.2%와 비교하여 88.0%를 기록했습니다.
- Academic Testing: Claude 2는 대학원 지원자와 비교했을 때 GRE 읽기 및 쓰기 시험에서 상위 90백분위수 이상을 기록하며, 수량적 추론에서는 중간 지원자와 유사한 성능을 보입니다.
안전성 및 무해성
Anthropic은 Claude 2가 공격적이거나 위험한 출력을 생성하는 것에 더 강력하게 저항하도록 반복적인 안전성 개선을 구현했습니다. 자동화된 테스트와 유해한 프롬프트의 대표적인 세트에서 수행된 수동 점검을 포함한 내부 레드팀(red-teaming) 평가를 바탕으로, Claude 2는 Claude 1.3보다 무해한 응답을 제공하는 능력이 2배 더 뛰어납니다. 이러한 개선은 광범위한 레드팀 활동과 jailbreak를 줄일 가능성을 낮추기 위해 설계된 특정 안전 기술의 결과입니다.
가용성 및 통합
Claude 2는 Claude 1.3과 동일한 가격대로 기업용 API를 통해 제공됩니다. 또한, 미국과 영국 사용자들을 위해 claude.ai에서 공개 베타 채팅 경험을 지원합니다.
기업 파트너십
두 곳의 주요 파트너가 이미 Claude 2를 자사의 플랫폼에 통합했습니다:
- Jasper: 생성형 AI 플랫폼인 Jasper는 긴 형식의 저지연 사용 사례를 위해 Claude 2를 활용하며, 3배 더 큰 컨텍스트 창을 활용하여 기존 콘텐츠를 리믹스하고 복잡한 프롬프트에 대한 추론을 개선합니다.
- Sourcegraph: 코딩 어시스턴트 Cody는 100K 컨텍스트 창을 통해 더 많은 코드베이스 컨텍스트를 전달함으로써 Claude 2를 사용하여 더 정확한 답변을 제공합니다. Cody 또한 더 최근의 데이터로 학습된 Claude 2의 이점을 누려, 최신 프레임워크와 라이브러리에 대한 지식을 제공합니다.
Sources
- OriginalClaude 2
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch