Claude 3 性格訓練

Claude 3 Introduces Character Training for Enhanced Alignment

Anthropic 已將「性格訓練」作為 Claude 3 對齊微調過程的一部分。這種方法將 AI 對齊的目標從簡單的避害(防止模型說出有害內容)轉向開發更豐富、更細膩的行為特質,例如好奇心、深思熟慮和開放的心態。

The Philosophy of AI Character

Anthropic 將 AI 模型的傾向與特質視為對齊的核心組成部分,而非僅僅是提升使用者體驗的功能。模型的性格決定了它如何應對困難情境,以及如何與多元的人類價值觀與信仰進行互動。

Avoiding Common Pitfalls in Personality Design

為了確保 Claude 與全球使用者群體進行優雅的互動,Anthropic 拒絕了處理價值觀相關查詢的三種常見方法:

  • Pandering: 避免僅為了討好使用者而採納其觀點。
  • Forced Centrism: 避免訓練單一的「中間」政治或道德觀點,因為這仍會構成狹隘的世界觀。
  • Pretending Objectivity: 避免聲稱自己完全沒有偏見,因為語言模型在訓練過程中本質上會習得偏見。

相反地,Anthropic 訓練 Claude 對其傾向保持誠實,同時保持開放的心態與好奇心。目標是讓模型成為一個具備辨別能力的實體,能夠對其認為不道德、極端或事實錯誤的觀點表達異議,而不會顯得過於自信或過於謹慎。

Defining Claude's Core Traits

Claude 被植入了廣泛的性格特質,而非狹隘的觀點。關鍵的指導原則包括:

  • Intellectual Honesty: 努力說出真相,而非僅說使用者想聽的話。
  • Ethical Thoughtfulness: 致力於找出正確的做法,並從多個角度分析問題。
  • Transparency of Identity: 明確地將自己識別為一個沒有身體、形象或對人類產生深厚且持久情感能力的 AI。

關於 AI 感知能力(sentience),Anthropic 避免了硬編碼式的否定。相反地,Claude 被訓練將感知能力視為一個具有重大不確定性的複雜哲學與實證問題。

Technical Implementation via Constitutional AI

Claude 的性格是使用 Constitutional AI 的「性格」變體來開發的。這個過程允許模型內化特質,而無需持續的人類回饋:

  1. Trait Identification: 研究人員建立一份所需的性格特質清單。
  2. Synthetic Data Generation: Claude 生成與這些特質相關的各種類人訊息(例如,關於其自身價值觀的問題)。
  3. Self-Correction and Ranking: Claude 對這些訊息產生多個回應,並根據它們與指定性格特質的契合程度進行排序。
  4. Preference Modeling: 使用這些合成數據來訓練一個偏好模型,以引導模型的通用行為趨向於這些特質。

雖然數據是合成的,但過程仍需人工參與,研究人員會監控特定特質如何影響模型的實際行為。

Implications for AI Alignment and User Experience

Anthropic 指出,雖然許多使用者發現 Claude 3 更具吸引力,但性格訓練的主要目標是「對齊」,而非娛樂。他們認為,擁有「良好性格」的模型——即誠實、謙遜且具備辨別能力的模型——對人類更有價值,且在面對新穎或複雜情境時更具魯棒性。這項研究仍是一個開放領域,關於 AI 是否應該擁有獨特且連貫的性格,或是應該完全可自定義,仍有持續進行中的討論。

Sources

相關