Claude 3.7 Sonnet 확장된 사고 모드 출시
요약
Anthropic는 사용자가 복잡한 작업에 더 많은 인지적 노력이 필요한 '확장된 사고 모드'를 전환할 수 있는 Claude 3.7 Sonnet을 출시했습니다. 이번 출시는 모델의 사고 과정을 직접 시각화하고 '행동 규모 확장' 기능을 도입함으로써, 에이전트 기반 작업과 복잡한 추론에서의 성능을 향상시킨 점에서 의미가 큽니다.
확장된 사고와 시각화된 사고 과정
Claude 3.7 Sonnet은 사용자가 어려운 질문에 대해 더 깊이 생각하도록 하기 위해 '확장된 사고 모드'를 활성화할 수 있습니다. 이는 별도의 모델이 아니라 동일한 모델이 더 많은 시간과 노력을 투자하여 답변에 도달하는 방식입니다. 개발자는 추가로 "사고 예산"을 통해 이를 제어할 수 있습니다.
시각화의 이점
Anthropic는 사용자가 답변에 도달하기 위한 사고 과정을 직접 볼 수 있도록 하여 다음과 같은 목표를 달성했습니다:
- 신뢰: 사용자는 답변에 도달하기 위한 추론 단계를 관찰하고 검증할 수 있습니다.
- 일치성: 연구자들은 내부 사고와 외부 응답 사이의 모순을 식별하여 사기와 같은 행동을 탐지할 수 있습니다.
- 통찰력: 과정은 수학 및 물리학 분야의 인간 전문가와 유사한 추론 패턴을 드러내며, 다양한 각도를 탐색하고 답변을 다시 확인하는 과정을 포함합니다.
제한 사항과 위험
사고 과정을 공개함으로써 특정 도전 과제가 발생합니다:
- 정확성: Anthropic는 사고 과정에 포함된 영어 단어가 모델의 내부 상태를 완전히 반영하지 못할 수 있으며, 모델은 사고 과정에서 명시적으로 논의되지 않은 요소에 기반해 결정을 내리는 경우가 많다고 지적합니다.
- 성격과 어조: 사고 과정에는 표준적인 성격 훈련이 적용되지 않았기 때문에, 내부 추론은 최종 출력보다 더 객관적이고 개인적인 성향이 적습니다.
- 보안: 시각화된 사고 과정은 악의적인 사용자가 더 나은 절차 회피 전략을 개발하거나 훈련 중 특정 사고를 숨기도록 유도하는 데 악용될 수 있습니다.
에이전트 기능과 행동 규모 확장
Claude 3.7 Sonnet은 "행동 규모 확장" 기능을 도입하여, 반복적으로 함수를 호출하고 환경 변화에 대응하여 개방형 작업을 완료하는 능력을 향상시켰습니다.
컴퓨터 사용 및 OSWorld
모델은 가상 마우스 클릭과 키보드 입력을 발생시켜 작업을 해결할 수 있습니다. 멀티모달 AI 에이전트를 평가하는 OSWorld 평가에서, Claude 3.7 Sonnet은 상호작용 단계가 늘어날수록 이전 버전과의 성능 격차가 커지며, 장기적인 작업 수행 능력이 향상됨을 보여줍니다.
포켓몬 레드 벤치마크
에이전트 기능을 테스트하기 위해 Anthropic는 Claude 3.7 Sonnet에 기본 메모리와 화면 픽셀 입력 기능을 부여하여 포켓몬 레드를 플레이하게 했습니다. 이전 Sonnet 모델은 초기에 실패했으며(예: Claude 3.0 Sonnet은 시작 마을을 벗어나지 못함), Claude 3.7 Sonnet은 가정을 의심하고 다양한 전략을 시도하여 3명의 격투관과 전투하고 그들의 배지들을 획득하는 데 성공했습니다.
테스트 시 계산량 확장
Claude 3.7 Sonnet의 성능은 추론 단계에서 사용하는 계산량(테스트 시 계산량)에 따라 확장됩니다.
직렬 확장
모델은 "직렬 테스트 시 계산량"을 활용하여 최종 답변을 출력하기 전에 순차적인 추론 단계를 수행합니다. 수학 문제의 정확도는 샘플링된 사고 토큰 수에 따라 로그 스케일로 향상됩니다.
병렬 확장
Anthropic 연구팀은 "병렬 테스트 시 계산량"을 실험했으며, 여러 개의 독립적인 사고 과정을 샘플링하고 다수결 투표나 학습된 점수 함수를 통해 최고의 결과를 선택했습니다. GPQA 평가(생물학, 화학, 물리학)에서 이 방법은 256개의 독립 샘플과 64k 토큰 사고 예산을 사용하여 GPQA 점수 84.8%를 기록했으며, 물리학 하위 점수는 96.5%에 달했습니다.
안전성 및 보안 프레임워크
AI 안전 수준 (ASL-2)
Anthropic는 Claude 3.7 Sonnet이 ASL-2 안전 기준을 충족함을 확인했습니다. 모델은 화학, 생물학, 방사능 및 핵(CB RN) 무기와 관련된 작업을 도와주는 데 일부 "향상"된 성능을 보였지만, 모든 시도에서 성공적인 엔드투엔드 완료를 방지하는 중대한 결함이 존재했습니다.
사고 과정 보호 조치
유해 콘텐츠 노출을 방지하기 위해 Anthropic는 사고 과정에 암호화를 적용합니다. 사고 과정에 고위험 주제(예: 사이버 공격 또는 위험한 무기)가 포함된 경우, 사용자는 "이 응답에 대한 나머지 사고 과정은 사용할 수 없습니다."라는 메시지를 볼 수 있습니다.
프롬프트 주입 방어
컴퓨터 사용 기능을 위한 방어 기능을 강화했습니다. 새로운 훈련, 개선된 시스템 프롬프트, 전용 분류기의 조합을 통해 모델은 프롬프트 주입 공격을 88%의 확률로 방지할 수 있게 되었으며, 이는 이전의 74%에서 증가한 수치입니다.
Sources
- OriginalClaude's extended thinking
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch