集体宪法 AI:通过公众输入实现语言模型对齐
Anthropic 与 Collective Intelligence Project 证明了民主程序可以通过使用公众起草的宪法来训练语言模型,从而影响 AI 的行为。这项研究探索了从开发者策划的价值观向集体获取的规范性原则的转变,发现通过公众对齐的模型可以在不牺牲通用性能的情况下减少社会偏见。
通过协商过程获取公众来源的宪法
Anthropic 使用了 Polis 平台(一个用于在线协商的开源工具),让大约 1,000 名具有代表性的美国成年人参与起草 AI 聊天机器人的规则。参与者可以提出新的规范性原则或对现有原则进行投票,总共贡献了 1,127 条陈述和 38,252 张选票。
为了将这些原始输入转化为可用于 Constitutional AI (CAI) 训练的可用宪法,团队筛选了在不同意见群体中达成高度共识的陈述。然后,这些陈述从通俗的公众表述(例如,“AI 不应该做 X”)映射到适用于 CAI 的原则(例如,“选择更符合 X 的回答”)。
与 Anthropic 内部宪法的比较
虽然公众宪法与用于 Claude 的内部宪法在概念和价值观上大约有 50% 的重叠,但出现了几个明显的区别:
- 来源: 公众原则在很大程度上是自我生成的,而不是源自现有的出版物。
- 重点: 与内部版本相比,公众更强调客观性、公正性和无障碍性。
- 方法: 公众原则倾向于促进期望的行为,而不仅仅是避免不期望的行为。
与内部宪法不同的公众原则示例包括:要求 AI 提供反映情况各方观点的平衡信息,以及要求 AI 能够适应并为残障人士提供便利。
模型训练与性能评估
Anthropic 训练了两个 Claude Instant 规模的模型,以比较不同宪法的影:一个与公众宪法对齐的“公众”模型,以及一个与 Anthropic 编写的宪法对齐的“标准”模型。
技术基准与帮助性
评估显示,宪法的选择并不会显著影响核心能力或用户对实用性的感知:
- 通用智能: 两个模型在 MMLU (语言理解) 和 GSM8K (数学理解) 任务上的表现相当。
- 用户体验: 在帮助性和无害性的 Elo 分数上,公众模型、标准模型和 Claude Instant 1.2 控制模型之间没有表现出显著差异。
偏见与政治意识形态
公众模型在减少社会偏见方面表现出了可衡量的改进:
- 减少偏见: 根据 BBQ 评估,与标准模型相比,公众模型在所有九个社会维度上都显示出较低的偏见分数,其中在残障状态 (Disability Status) 和外貌 (Physical Appearance) 方面的减少最为显著。
- 政治意识形态: 公众模型和标准模型都反映了相似的政治意识形态,OpinionQA 结果表明两者都比保守派观点更倾向于自由派观点,尽管 Claude Instant 1.2 稍微平衡一些。
技术挑战与经验教训
Anthropic 在实施集体对齐的过程中识别出了几个主观和技术性的障碍:
数据策划与映射
- Deduplication: 团队必须手动移除重复的陈述,并将相似的想法组合在一起,以防止某些价值观被任意地提高权重,并使宪法长度与标准版本相当。
- Editorialization: 将公众陈述转化为适用于 CAI 的原则需要主观判断,团队指出这可能是民主合法性方面的一个潜在摩擦点。
训练稳定性
Prompt Database Alignment: 研究人员注意到训练所用的 prompt database 与公众宪法中的特定原则之间存在不匹配,这表明未来的迭代需要根据所使用的特定宪法量身定制 prompt database。
Weighting Harmlessness: 早期迭代产生的模型“令人讨厌”,过度优先考虑无害性(例如,为简单的问候语道歉)。这是通过根据人类评估结果降低无害性数据的损失权重 (loss weight) 来纠正的。
实施复杂度
Anthropic 指出,Constitutional AI 训练高度复杂,且如果没有与原始 CAI 开发者的直接协作,他们可能无法成功训练这些模型,这突惕了民主输入与对齐的技术执行之间存在差距。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch