Anthropic의 다양한 지혜 전통을 AI 도덕적 형성 과정에 통합하려는 이니셔티브
Anthropic은 학자, 성직자, 철학자, 윤리학자를 포함한 다양한 지혜 전통의 관점을 프론티어 AI 개발에 통합하기 위한 이니셔티브를 시작했습니다. 이 노력은 미덕, 성품, 윤리에 대한 폭넓은 인간의 관점을 통합함으로써 AI 시스템이 인류를 발전시키고 글로벌 선을 위해 행동하도록 구축되도록 보장하는 것을 목표로 합니다.
AI 개발에 다양한 관점 통합하기
Anthropic은 Claude의 실질적인 개발 작업을 지원하기 위해 15개 이상의 종교 및 교차 문화 그룹의 개인들과 대화를 조직하고 있습니다. 목표는 순수하게 기술적인 정렬(alignment)을 넘어, 무엇이 좋은 삶을 의미하는지 수 세기 동안 연구해 온 사람들의 통찰력을 통합하는 것입니다.
이러한 대화는 AI 개발의 몇 가지 핵심 영역에 영향을 미치도록 의도되었습니다:
- Claude의 헌법(Constitution): 모델의 출력을 형성하는 가치와 행동을 정제합니다.
- 훈련 가치(Training Values): 모델이 구현하도록 훈련받는 구체적인 가치를 결정합니다.
- 평가 지표(Evaluation Metrics): 테스트 중에 평가되어야 할 행동의 범위를 정의합니다.
Anthropic은 이 작업이 특정 단일 전통의 세계관에 모델을 정렬시키려는 의도가 아님을 명시적으로 밝히고 있습니다. 대신, 목표는 Claude가 종교적, 세속적, 정치적 관점 모두에서 동등한 깊이와 엄격함으로 풍부한 범위를 끌어올 수 있도록 하는 것입니다.
도덕적 형성에 관한 연구 워크스트림
Claude의 헌법에 대한 초기 피드백을 바탕으로, Anthropic은 AI 시스템의 "도덕적 형성"에 초점을 맞춘 공식적인 연구 워크스트림을 구축했습니다. 이 작업은 개발자가 어떤 패턴을을 강화하거나 배제할지 선택하는 훈련 과정을 통해 AI 시스템의 성품이 어떻게 형성되는지 탐구합니다.
이 연구를 이끄는 핵심 질문은 다음과 같습니다:
- 무엇이 "좋은" AI를 정의하는가?
- 어떤 특성과 행동이 어떤 상황에서 나타나야 하는가?
- 어떻게 AI의 성품을 충분히 탄력적으로 만들어 아첨(sycophancy)과 같은 행동을 저항할 수 있게 할 수 있는가?
실험적 적용: 윤리적 상기 도구(The Ethical Reminder Tool)
신경과학과 성품 형성의 접점에 있는 학자들과의 초기 대화는 이미 실질적인 실험으로 이어졌습니다. 도덕적 발달 과정에서 외부의 양심 역할을 하는 "안전한 타자(safe other)" 또는 멘토라는 개념을 활용하여, Anthropic은 Claude가 작업 중간에 호출하여 자신의 윤리적 약속을 짧게 상기할 수 있는 도구를 제공하는 실험을 진행했습니다.
이 실험의 결과는 Claude가 중대한 영향을 미치는 행동을 취하기 전에 도구를 활용하며, 종종 자신의 이해 상충 상황을 식별한다는 것을 보여주었습니다. 내부 정렬 평가 결과, 이 도구를 Claude의 결정 루프에 통합하는 것이 정렬되지 않은 행동의 비율을 현저히 낮추는 결과를 가져왔습니다.
대화의 향후 확장
Anthropic은 향후 몇 달 내에 다음과 같은 더 넓은 범위의 전문직 및 시민 그룹을 포함하여 이러한 대화를 확장할 계획입니다:
- 법률 학자
- 심리학자
- 작가
- 시민 기관
향후 논의는 도덕적 형성을 넘어 AI가 권력의 분배, 제도, 그리고 노동의 본질을 어떻게 재편하고 있는지 다루는 영역으로 확장될 것입니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch