OpenAI 超级对齐快速资助

OpenAI 已启动一项 $1000 万美元的资助计划,以支持确保超人类 AI 系统安全与对齐的技术研究。此举旨在应对人类如何引导和信任能力远超人类智能的 AI 系统这一关键挑战。

超人类 AI 对齐的挑战

使超人类 AI 系统实现对齐所面临的技术挑战与当前 AI 对齐根本不同。虽然当前系统通常通过基于人类反馈的强化学习(RLHF)进行对齐,但这种方法依赖于人类监督,而在 AI 能力超越人类理解时,这种监督变得不足。

超人类 AI 系统可能表现出人类无法完全评估的复杂且富有创造力的行为。例如,OpenAI 指出,如果一个超人类模型生成了一百万行高度复杂的代码,人类审查者将无法可靠地判断该代码是否安全或危险可执行。因此,核心技术问题是确定人类如何能够对显著超越自身智能的系统保持控制和信任。

超级对齐快速资助计划详情

OpenAI 与 Eric Schmidt 合作,向学术实验室、非营利组织和个人研究者提供总计 $1000 万美元的资助。该计划旨在吸引既有经验的对齐研究者以及该领域的新人。

资助层级和资格

  • 一般资助: 面向个人研究者、非营利组织和学术实验室提供的资助金额范围为 $100,000 至 $2,000,000。
  • OpenAI 超级对齐奖学金: 面向研究生的一年期奖学金,提供 $75,000 的 stipend 以及 $75,000 的算力和研究经费(合计 $150,000)。
  • 经验要求: 申请无需具备 AI 对齐的先前经验。

优先研究方向

OpenAI 已确定若干关键技术领域,在这些领域中他们正在寻求对齐与安全方面的突破。

弱到强泛化

此研究聚焦于强模型如何从“弱”监督者(人类)的监督中进行泛化。目标是理解并控制超人类模型如何从能力较弱的实体提供的反馈中学习。

可解释性

可解释性研究旨在理解 AI 模型的内部机制。该研究的一个主要应用是开发诸如 “AI 说谎探测器” 之类的工具,以验证模型的诚实性。

可扩展监督

可扩展监督涉及使用 AI 系统协助人类操作员评估其他 AI 系统的输出,尤其是在执行超出个人人类能力的复杂任务时。

其他研究领域

OpenAI 还对以下方面的研究感兴趣:

  • 诚实性
  • 思维链忠实度
  • 对抗鲁棒性
  • 评估和测试平台

Sources