Claude 3.5 Sonnet 출시 노트 / 새 기능 소개

Anthropic는 Claude 3.5 모델 패밀리의 첫 번째 출시인 Claude 3.5 Sonnet을 공개했습니다. 이 모델은 다양한 평가에서 경쟁 모델과 이전 최상위 모델인 Claude 3 Opus를 능가하는 지능을 제공하면서도, 중급 모델 수준의 속도와 비용 프로파일을 유지합니다.

성능 및 지능 벤치마크

Claude 3.5 Sonnet은 대학원 수준의 추론(GPQA), 대학 수준의 지식(MMLU), 그리고 코딩 능력(HumanEval)에서 산업 최고 수준의 기준을 수립했습니다. 모델은 미묘한 뉘앙스, 유머를 이해하고 복잡한 지시사항을 따르는 능력에서 큰 향상이 있었으며, 자연스러운 어조로 고품질 콘텐츠를 생성합니다.

에이전트형 코딩 기능

내부 에이전트형 코딩 평가에서 Claude 3.5 Sonnet은 문제의 64%를 해결했으며, Claude 3 Opus는 38%만 해결했습니다. 이러한 테스트는 자연어 설명에 기반해 오픈소스 코드베이스의 버그를 수정하거나 기능을 추가할 수 있는 능력을 측정합니다. 관련 도구를 갖추면 모델은 코드를 독립적으로 작성, 편집, 실행할 수 있어 코드 번역 및 레거시 애플리케이션 마이그레이션과 같은 작업을 지원합니다.

속도, 비용, 가용성

Claude 3.5 Sonnet은 Claude 3 Opus보다 두 배 빠르게 작동합니다. 성능 향상과 비용 효율성의 조합으로 인해 다단계 워크플로우 및 맥락 기반 고객 지원에 적합합니다.

가격 및 기술 사양:

  • 입력 비용: 100만 토큰당 $3
  • 출력 비용: 100만 토큰당 $15
  • 컨텍스트 창 크기: 200K 토큰

가용성:

  • 무료 접근: Claude.ai 및 Claude iOS 앱에서 이용 가능.
  • 유료 접근: Claude Pro 및 팀 플랜 구독자는 더 높은 요청 제한을 제공받습니다.
  • API/클라우드 접근: Anthropic API, Amazon Bedrock, Google Cloud의 Vertex AI를 통해 이용 가능.

시각적 추론 및 비전 기능

Claude 3.5 Sonnet은 Anthropic가 현재까지 개발한 가장 강력한 비전 모델로, 표준 비전 벤치마크에서 Claude 3 Opus를 능가합니다. 특히 차트와 그래프를 해석하고 품질이 낮은 이미지에서 텍스트를 정확히 인식하는 능력에서 두드러진 향상이 있습니다. 이러한 기능은 소매, 물류, 금융 서비스 산업에 특히 유용합니다.

Artifacts: 협업 워크스페이스

Anthropic는 Claude.ai에 "Artifacts" 기능을 도입했습니다. 이 기능은 대화형 AI 인터페이스를 협업 작업 환경으로 전환합니다. Claude가 코드 스니펫, 웹사이트 디자인, 텍스트 문서를 생성하면, 대화와 함께 전용 창에 표시됩니다. 사용자는 AI가 생성한 콘텐츠를 실시간으로 확인하고 편집하며 확장할 수 있습니다.

안전성, 개인정보 보호 및 외부 평가

Claude 3.5 Sonnet은 레드팀 평가 기준으로 AI 안전성 수준 2(ASL-2)를 유지합니다. 안전성을 보장하기 위해 Anthropic는 UK의 인공지능 안전연구소(UK AISI)와 협력하여 출시 전 안전성 평가를 수행했으며, 결과를 미국 AI 안전연구소(US AISI)와 공유했습니다.

안전성 및 개인정보 보호 조치:

  • 외부 전문가의 참여: Thorn의 아동 안전 전문가를 포함한 분야 전문가의 피드백을 통합하여 분류기와 모델을 정교화했습니다.
  • 데이터 프라이버시: 사용자가 명시적인 동의 없이 생성 모델이 사용자 제출 데이터를 학습하지 않습니다.

향후 로드맵

Anthropic는 올해 후반에 Claude 3.5 Haiku와 Claude 3.5 Opus를 출시하여 모델 패밀리를 완성할 계획입니다. 향후 개발 방향으로는 새로운 모달리티, 기업용 애플리케이션 통합, 사용자 선호도와 상호작용 기록을 기억할 수 있는 "메모리" 기능이 포함됩니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch