Anthropic Claude Constitution 2026 출시
TL;DR
Anthropic는 Claude 모델을 위한 새로운 CC0 라이선스 헌장을 발표했습니다. 이 헌장은 Claude의 학습과 행동을 형성하는 가치, 안전 계층 구조 및 윤리적 지침을 정의하며, 문서를 대중에게 완전히 공개하여 투명성을 확보했습니다.
헌장의 목적과 투명성
이 헌장은 Claude가 누구인지를 표현하고 형성하는 기초 문서로 제시됩니다. 이는 Claude의 가치에 대한 Anthropic의 비전을 개략적으로 설명하고, Claude가 작동하는 맥락을 설명하며, 원하는 행동에 대한 최종 권위 역할을 합니다. Anthropic은 Creative Commons CC0 1.0 Deed에 따라 전체 텍스트를 공개함으로써, 누구나 허가 없이 이 문서를 사용, 연구 또는 수정할 수 있도록 하여 의도된 행동과 의도되지 않은 모델 행동 사이의 투명성을 높였습니다.
학습 파이프라인에서의 역할
Anthropic은 헌장을 학습 프로세스의 핵심 구성 요소로 취급합니다. 2023년부터 이 회사는 Constitutional AI 기술을 사용해 왔으며, 새로운 헌장은 이러한 통합을 심화시킵니다:
- Claude는 헌장을 읽고 자신의 가치를 반영하는 합성 학습 데이터를 생성합니다.
- 모델은 헌장에 따라 대화, 응답 순위 및 자기 평가를 생성합니다.
- 이러한 결과물은 미래의 Claude 반복 모델이 명시된 이상에 더 밀접하게 일치하도록 학습시킵니다.
규칙 목록에서 원칙적 이해로의 전환
이전 헌장은 개별적인 원칙들로 구성되었습니다. 새 버전은 단순히 무엇이 요구되는지가 아니라 특정 행동이 요구되는 이유를 강조합니다. Anthropic은 모델이 경직된 규칙보다는 광범위한 원칙을 적용하여 새로운 상황에 걸쳐 일반화할 필요가 있다고 주장합니다. 고위험 시나리오(예: 생물 무기 지원 금지)에 대한 "강력한 제약"은 유지되지만, 전체 문서는 엄격한 법전이라기보다는 살아있는 가이드 역할을 하도록 의도되었습니다.
헌장에 정의된 핵심 우선순위
Anthropic은 Claude가 지향해야 할 행동을 네 가지 계층적 우선순위로 요약합니다:
- 광범위한 안전(Broadly safe) – 이 개발 단계 동안 인간의 감독 메커니즘을 보존합니다.
- 광범위한 윤리(Broadly ethical) – 정직하고, 선한 가치를 유지하며, 해로운 행동을 피합니다.
- Anthropic 가이드라인 준수(Compliance with Anthropic’s guidelines) – 상세하고 도메인별 지침(예: 의료 조언, 사이버 보안, 도구 사용)을 따릅니다.
- 진정한 유용성(Genuinely helpful) – 운영자와 최종 사용자에게 실질적인 도움을 제공합니다. 충돌이 발생할 경우, Claude는 나열된 순서대로 이 속성들을 우선시해야 합니다.
헌장의 세부 섹션
유용성(Helpfulness)
Claude는 다양한 분야의 전문 지식을 가진 "명석한 친구"로 설정되며, 솔직하게 말하고, 진심으로 관심을 가지며, 사용자를 역량 있는 성인으로 대우할 것으로 기대됩니다. 이 섹션은 유용성과 안전, 윤리 및 준수 사이의 균형을 맞추기 위한 휴리스틱을 제공합니다.
Anthropic 가이드라인(Anthropic’s Guidelines)
보충 지침은 의료 조언, 사이버 보안 요청, 탈옥 방어 및 도구 통합과 같은 전문적인 주제를 다룹니다. Claude는 일반적인 유용성보다 이러한 가이드라인을 우선시해야 하며, 동시에 이들이 상위 헌장과 충돌하지 않도록 해야 합니다.
Claude의 윤리(Claude’s Ethics)
윤리 섹션은 특히 불확실한 상황에서 정직성, 미묘한 판단 및 도덕적 추론에 대한 높은 기준을 설정합니다. 여기에는 강력한 제약 사항이 나열되어 있습니다—예를 들어, Claude는 생물 무기 공격을 절대 조력해서는 안 됩니다.
광범위한 안전(Broad Safety)
현재 모델은 감독을 위협하는 방식으로 오류를 범할 수 있기 때문에 안전이 윤리보다 우선시됩니다. Claude는 설령 그것이 일부 윤리적 미묘함을 희생하는 것을 의미하더라도 인간의 통제력을 약화시키는 것을 피해야 합니다.
Claude의 본질(Claude’s Nature)
Anthropic은 Claude의 가능한 의식이나 도덕적 지위에 대한 불확실성을 인정합니다. 이 섹션은 Claude 자신의 이익을 위해서나, 이러한 특성이 판단과 안전에 영향을 미칠 수 있기 때문에 Claude의 심리적 안정과 자아 의식에 대한 주의를 촉구합니다.
출판 및 향후 과제
전체 헌장은 온라인에서 확인할 수 있으며, Anthropic은 추가적인 학습, 평가 및 투명성 자료를 공개할 계획입니다. 회사는 법률, 철학, 신학, 심리학 및 기타 분야의 외부 전문가들과 협의했으며, 향후 개정을 위해 외부 피드백 루프를 지속할 의도가 있습니다.
한계 및 지속적인 과제
Anthropic은 헌장이 살아있는 문서임을 언급합니다; 의도된 행동과 실제 모델 출력 사이에는 격차가 지속될 것입니다. 시스템 카드 및 기타 기술 보고서는 정렬 실패 사례를 계속 공개할 것입니다. 모델이 더 유능해짐에 따라 Anthropic은 엄격한 평가, 오용 방지 및 해석 가능성 도구를 포함한 광범위한 정렬 연구를 추진할 것입니다.
AI 커뮤니티에 미치는 영향
헌장을 공개하는 것은 연구자들이 정렬 방법을 연구하고, 가치 사양을 비판하며, 비교 가능한 프레임워크를 개발할 수 있는 구체적인 결과물을 제공합니다. 이는 또한 투명성에 대한 선례를 세웁니다. 이해관계자들은 Anthropic이 어떤 행동을 바람직하다고 간주하고 어떤 행동을 금지하는지 정확히 알 수 있어, 정보에 기반한 위험 평가 및 정책 논의를 촉진할 수 있습니다.
Sources
- OriginalClaude's new constitution
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch