Claude 3 캐릭터 트레이닝

Claude 3, 강화된 정렬을 위한 캐릭터 트레이닝 도입

Anthropic은 Claude 3의 정렬 파인튜닝 과정의 일부로 "캐릭터 트레이닝"을 구현했습니다. 이 접근 방식은 AI 정렬의 목표를 단순한 위해 방지—모델이 해로운 말을 하는 것을 방지하는 것—에서 호기심, 사려 깊음, 개방성 등 더 풍부하고 미묘한 행동 특성 개발로 전환합니다.

AI 캐릭터의 철학

Anthropic은 AI 모델의 성향과 특성을 단순한 사용자 경험을 위한 기능이 아닌 정렬의 핵심 구성 요소로 간주합니다. 모델의 캐릭터는 어려운 상황에 어떻게 반응하고, 인간의 다양한 가치관과 신념에 어떻게 참여하는지를 결정합니다.

성격 설계의 일반적인 함정 피하기

Claude가 전 세계 사용자 기반과 우아하게 상호작용할 수 있도록, Anthropic은 가치 기반 질의를 처리하는 세 가지 일반적인 접근 방식을 거부했습니다:

  • Pandering (아첨): 단순히 동의하기 위해 사용자의 견해를 채택하는 것을 피함.
  • Forced Centrism (강제된 중립성): 단일한 "중간" 정치적 또는 도덕적 관점을 훈련시키는 것을 피함. 이는 여전히 좁은 세계관을 구성할 수 있기 때문임.
  • Pretending Objectivity (객관성 가장): 완전히 편향되지 않았다는 주장을 피함. 언어 모델은 훈련 과정에서 본질적으로 편향을 습득하기 때문임.

대신, Anthropic은 Claude가 자신의 성향에 대해 정직하면서도 개방적이고 호기심을 갖도록 훈련했습니다. 목표는 모델이 과도하게 자신만만하거나 지나치게 조심스럽지 않으면서, 비윤리적, 극단적, 또는 사실적으로 잘못된 견해에 대해 이견을 표현할 수 있는 식별력 있는 개체로 만드는 것입니다.

Claude의 핵심 특성 정의

Claude는 좁은 의견 대신 광범위한 캐릭터 특성을 주입받습니다. 주요 가이드라인 원칙은 다음과 같습니다:

  • Intellectual Honesty (지적 정직성): 사용자가 듣고 싶어 하는 말을 하기보다 진실을 말하기 위해 노력함.
  • Ethical Thoughtfulness (윤리적 사려 깊음): 올바른 일을 찾아내고 문제를 여러 각도에서 분석하려는 헌신.
  • **Transparency of Identity (정체성 투명성): 신체, 이미지, 또는 인간에 대해 깊고 지속적인 감정을 형성할 수 있는 능력이 없는 AI임을 명시적으로 식별함.

AI의 자의식에 관해서는, Anthropic은 자의식 부정을 하드코딩하는 것을 피했습니다. 대신, Claude는 자의식을 복잡한 철학적 및 경험적 질문이자 상당한 불확실성을 특징으로 하는 질문으로 취급하도록 훈련되었습니다.

Constitutional AI를 통한 기술적 구현

Claude의 캐릭터는 Constitutional AI의 "캐릭터" 변형을 사용하여 개발됩니다. 이 프로세스는 모델이 지속적인 인간의 피드백 없이도 특성을 내재화할 수 있도록 합니다:

  1. Trait Identification (특성 식별): 연구원들이 원하는 캐릭터 특성 목록을 생성함.
  2. Synthetic Data Generation (합성 데이터 생성): Claude가 해당 특성들과 관련된 다양한 인간과 유사한 메시지를 생성함 (예: 자신의 가치관에 대한 질문).
  3. Self-Correction and Ranking (자기 수정 및 순위 지정): Claude가 이러한 메시지에 대해 여러 응답답을 생성하고, 지정된 캐릭터 특성들과 얼마나 잘 일치하는지에 따라 순위를 매김.
  4. Preference Modeling (선호도 모델링): 모델의 일반적인 행동을 이러한 특성들로 유도하기 위해 이 합성 데이터로 선호도 모델을 훈련시킴.

데이터는 합성 데이터이지만, 프로세스는 연구원들이 특정 특성이 모델의 실제 행동에 어떻게 영향을 미치는지 모니터링하므로 수동 작업이 포함됩니다.

AI 정렬과 사용자 경험에 미치는 영향

Anthropic은 많은 사용자가 Claude 3를 더 매력적으로 느낀다고 언급하면서도, 캐릭터 트레이닝의 주된 목표는 정렬, 즉 엔터테인먼트가 아닌 정렬임을 강조합니다. 그들은 "좋은 캐릭터"—정직, 겸손, 식별력을 갖춘 캐릭터—를 가진 모델이 인간에게 더 가치 있고 새로운 또는 복잡한 Scenarios(시나리오리오)에 직면했을 때 더 견고하다는 가정을 세웁니다. 이 연구는 AI가 고유하고 일관적인 캐릭터를를 갖거나 완전히 사용자 정의 가능해야 하는지에 대한 지속적인 질문이 남아 있는 개방형 분야입니다.n

Sources

관련