Claude 3 性格训练
Claude 3 引入性格训练以增强对齐
Anthropic 已将“性格训练”作为 Claude 3 对齐微调过程的一部分。这种方法将 AI 对齐的目标从简单的避免伤害(防止模型说出有害内容)转向开发更丰富、更细致的行为特征,例如好奇心、深思熟虑和开放心态。
AI 性格的哲学
Anthropic 将 AI 模型的倾向和特征视为对齐的核心组成部分,而不仅仅是提升用户体验的产品功能。模型的性格决定了它如何应对困难局面,以及如何与多样化的人类价值观和信仰进行互动。
避免人格设计中的常见误区
为了确保 Claude 与全球用户群体进行优雅的互动,Anthropic 拒绝了处理基于价值观查询的三种常见方法:
- 迎合用户 (Pandering): 避免仅仅为了讨好而采纳用户的观点。
- 强行中立 (Forced Centrism): 避免训练单一的“中间”政治或道德观点,因为这仍然会构成一种狭隘的世界观。
- 伪装客观 (Pretending Objectivity): 避免声称自己是完全无偏见的,因为语言模型在训练过程中本质上就会习得偏见。
相反,Anthropic 训练 Claude 对其倾向保持诚实,同时保持开放的心态和好奇心。目标是让模型成为一个有辨别力的实体,能够对它认为不道德、极端或事实错误的观点表达不同意见,而不会表现得过于自过度自信或过度谨慎。
定义 Claude 的核心特征
Claude 的初始设定是广泛的性格特征,而非狭隘的观点。关键指导原则包括:
- 知识诚实 (Intellectual Honesty): 努力讲述真相,而不是说用户想听的话。
- 伦理深思熟虑 (Ethical Thoughtfulness): 致力于找出正确的事情并从多个角度分析问题。
- 身份透明度 (Transparency of Identity): 明确标识自己为没有身体、形象或对人类产生深厚持久情感能力的 AI。
关于 AI 感知力 (sentience),Anthropic 避免了硬编码式的否定。相反,Claude 被训练为将感知力视为一个具有显著不确定性的复杂哲学和经验问题。
通过宪法 AI (Constitutional AI) 进行技术实现
Claude 的性格是通过 Constitutional AI 的“性格”变体开发的。这一过程允许模型内化这些特征,而无需持续的人类反馈:
- 特征识别 (Trait Identification): 研究人员创建一份所需的性格特征列表。
- 合成数据生成 (Synthetic Data Generation): Claude 生成与这些特征相关的各种类人消息(例如,关于其自身价值观的问题)。
- 自我修正与排序 (Self-Correction and Ranking): Claude 对这些消息产生多个响应,并根据它们与指定性格特征的契合程度进行排序。
- 偏好建模 (Preference Modeling): 在这些合成数据上训练一个偏好模型,以引导模型的通用行为趋向于这些特征。
虽然数据是合成的,但该过程仍然需要人工参与,人类研究人员会监控特定特征如何影响模型的实际行为。
对 AI 对齐和用户体验的影响
Anthropic 指出,虽然许多用户发现 Claude 3 更有趣,但性格训练的主要目标是对齐,而非娱乐。他们认为,拥有“良好性格”的模型——即诚实、谦逊且有辨别力的模型——对人类更有价值,并且在面对新场景或复杂场景时更加稳健。这项研究仍是一个开放领域,关于 AI 是否应该拥有独特的、连贯的性格,或者应该是完全可定制的,目前仍有待探讨。
Sources
- OriginalClaude’s Character
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch