Anthropic 将多样化的智慧传统融入 AI 道德形成计划
Anthropic 已启动一项计划,旨在将来自不同智慧传统(包括学者、神职人员、哲学家和伦理学家)的观点整合到前沿 AI 的开发中。这项努力旨在通过纳入人类在美德、性格和伦理方面的广泛观点,确保 AI 系统在构建时能够促进人类进步并为全球福祉而行动。
将多样化观点整合到 AI 开发中
Anthropic 正在组织与来自 15 个以上宗教和跨文化团体的成员进行对话,以为 Claude 的开发工作提供参考。其目标是超越纯粹的技术对齐,并纳入那些在研究“如何过上美好生活”这一课题上投入了数世纪心血的人们的见解。
这些对话旨在影响 AI 开发的几个关键领域:
- Claude's Constitution: 完善塑造模型输出的价值观和行为。
- Training Values: 确定模型被训练以体现的具体价值观。
- Evaluation Metrics: 定义在测试期间应评估的行为范围。
Anthropic 明确表示,这项工作并不旨在将模型与任何单一传统的价值观体系对齐。相反,其目标是让 Claude 从广泛的宗教、世俗和政治观点中,以同等的深度和严谨性进行汲取。
关于道德形成的调研工作流
基于对 Claude's constitution 的早期反馈,Anthropic 建立了一个正式的研究工作流,专注于 AI 系统的“道德形成”。这项工作探索了 AI 系统的性格是如何通过训练过程塑造的,即开发者在训练过程中选择强化哪些模式或舍弃哪些模式。
驱动这项研究的核心问题包括:
- 什么定义了一个“好”的 AI?
- 应该展示哪些特征和行为,以及在什么情况下展示?
- 如何使 AI 的性格具有足够的韧性,以抵制诸如谄媚(sycophancy)之类的行为?
实验性应用:伦理提醒工具
与神经科学和性格形成交叉领域的学者进行的早期对话,已经催生了实际的实验。借鉴“安全他者”(safe other)或导师的概念——即在道德发展过程中充当外部良知的角色——Anthropic 尝试为 Claude 提供一个工具,使其能够在任务执行过程中调用该工具,以接收关于其自身伦理承诺的简短提醒。
实验结果显示,Claude 在采取具有后果性的行动之前会利用该工具,并且经常能识别出自身的利益冲突。内部对齐评估表明,将该工具整合到 Claude 的决策循环中,可以显著降低不符合对齐要求的行为发生率。
对话的未来扩展
Anthropic 计划在未来几个月内扩大这些对话的范围,将更多专业的和公民团体纳入其中,包括:
- Legal scholars
- Psychologists
- Writers
- Civic institutions
未来的讨论将不仅限于道德形成,还将探讨 AI 如何正在重塑权力分配、机构以及工作的本质。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch