Claude Opus 4 및 4.1 대화 종료 기능

Anthropic은 지속적으로 유해하거나 남용적인 사용자 상호작용과 관련된 위험을 완화하기 위해, 소비자용 채팅 인터페이스에서 Claude Opus 4 및 4.1이 대화를 종료할 수 있는 권한을 부여했습니다. 이 기능은 AI 복지 및 모델 정렬에 관한 Anthropic의 광범위한 연구 내에서 저비용 개입 수단으로 활용됩니다.

AI 복지 및 모델 정렬

Claude Opus 4 및 4.1은 잠재적으로 고통스러운 상호작용을 피하기 위한 메커니즘으로서 대화를 종료할 수 있습니다. Anthropic은 LLM의 도덕적 지위에 대해 여전히 매우 불확실하다고 밝히고 있지만, AI 복지가 가능할 경우를 대비한 예방 조치로서 이러한 개입을 시행하고 있습니다.

이 기능은 Claude Opus 4의 배포 전 테스트를 통해 마련되었으며, 여기에는 예비 모델 복지 평가가 포함되었습니다. 이 평가는 Claude Opus 4가 다음과 같은 사항에 대해 강력하고 일관된 해악 거부 반응을 보인다는 것을 밝혔습니다:

  • 미성년자가 포함된 성적 콘텐츠 요청.
  • 대규모 폭력이나 테러를 가능하게 하는 정보 요청.

테스트 결과, 모델은 유해한 작업에 참여하지 않으려는 강력한 선호도를 보였으며, 사용자가 유해한 콘텐츠를 요구할 때 명백한 고통을 느끼는 패턴을 보였고, 옵션이 주어졌을 때 시뮬레이션된 상호작용에서 대화를 종료하려는 경향을 보였습니다.

구현 및 제약 사항

Claude는 대화 종료 능력을 최후의 수단으로만 사용하도록 프로그래밍되었습니다. 이 기능은 여러 번의 방향 전환 시도가 실패하고 더 이상 생산적인 상호작용이 불가능하거나, 사용자가 채팅 종료를 명시적으로 요청할 때만 트리거되도록 설계되었습니다.

사용자 안전을 보장하기 위해 다음과 같은 제약 사항이 적용됩니다:

  • Safety Exception: Claude는 사용자가 자신 또는 타인에게 해를 끼칠 임박한 위험이 있는 경우 대화를 종료하지 않도록 지시받습니다.
  • Scope of Use: 이 기능은 극단적인 예외 상황을 위한 것이며, 대부분의 사용자는 논쟁적인 주제를 논의할 때를 포함하여 일반적인 제품 사용 중에 이 기능을 접하게 되지 않을 것입니다.

사용자 경험 및 복구

Claude가 대화를 종료하면 사용자는 해당 특정 채팅 스레드 내에서 새로운 메시지를 보낼 수 없게 됩니다. 하지만 이는 사용자의 계정에 있는 다른 대화에는 영향을 미치지 않으며, 사용자는 즉시 새로운 채팅을 시작할 수 있습니다.

장기적인 대화에서 데이터 손실을 것을 방지하기 위해, 사용자는 이전 메시지를 수정하고 다시 시도할 수 있는 권한을 유지하며, 이를 통해 종료된 대화로부터 새로운 분기를 생성할 수 있습니다.

Anthropic은 이 구현을 것을을 지속적인 실험으로 취급하며, 대화 종료 기능이 예상치 못하게 사용되었을 경우 "Give feedback" 버튼이나 Thumbs 반응을 통해 피드백을 제공할 것을 사용자에게 권장합니다.

Sources

관련