AI 安全需要社会科学家
OpenAI 发布了一篇论文,认为长期的 AI 安全研究必须结合社会科学,以确保对齐算法在与真实人类互动时能够取得成功。由于将先进的 AI 系统与人类价值观对齐需要应对人类理性、情感和偏见中的心理学问题,OpenAI 正在积极招募社会科学家与机器学习研究人员合作。
人类价值观对齐的挑战
AI 对齐的目标是确保先进的 AI 系统能够可靠地执行人类希望它们执行的操作。OpenAI 目前的方法包括询问人们的价值观,利用这些数据训练机器学习 (ML) 模型,并优化系统以使其根据这些学习到的模型进行操作。这项研究通过诸如 Learning from Human Preferences、AI Safety via Debate 和 Learning Complex Goals with Iterated Amplification 等方法来实现。
然而,由于多种因素,人类的输入往往是不可靠的:
- 认知偏见: 人类表现出各种认知偏见和不一致的伦理信念,这些信念在反思后可能无法成立。
- 语境敏感性: 问题表述的方式可以显著改变答案。例如,在问题中加入“道德上”一词可能会改变对某项行为错误性的判断。
- 复杂性: 人们在面对复杂任务(如赌博)时,往往会做出不一致的选择。
通过纯人类实验弥补差距
虽然 OpenAI 利用放大 (amplification) 和辩论 (debate) 等方法来针对人类价值观背后的推理过程,但这些算法在现实的、以人为中心的情度的境下行为如何,仍然是未知的。目前的机器学习可能过于薄弱,无法发现那些仅在针对复杂且带有价值观的问题进行自然语言讨论时才会出现的对齐问题。
为了绕过当前 ML 的局限性,OpenAI 建议进行完全由人类参与的实验。在这些实验中,人们扮演 AI 智能体 (agents) 的角色。例如,在“辩论”对齐方法中——通常涉及两个 AI 辩论者和一个人类法官——研究人员可以使用两个人类辩论者和一个人类法官,来观察该过程在实践中是如何运作的。从这些纯人类互动中获得的经验可以随后转移到机器学习模型的开发中。
社会科学在 AI 安全中的作用
仅凭机器学习方面的专业知识不足以设计和执行以下类型的人类中心实验。这些研究需要基于现有的人类认知和行为知识进行严谨的实验设计。
OpenAI 识别出几个对这项跨学科工作至关重要的社会科学领域,包括:
- 实验心理学
- 认知科学
- 经济学
- 政治学
- 社会心理学
- 神经科学
- 法律
协作倡议
作为实现这种整合的第一步,OpenAI 研究人员与斯坦福大学行为科学高级研究中心 (CASBS) 合作组织了一场研讨会。这一合作伙伴关系涉及与 Mariano-Florentino Cuéllar、Margaret Levi 和 Federica Carugati 等专家的持续会议,以讨论社会科学与 AI 对齐的交集点。