测量大规模监督在大型语言模型上的进展

Anthropic 提出了一种衡量大规模监督进展的框架,即监督那些能力超越人类的AI系统的挑战。这项研究至关重要,因为开发安全且有用的通用AI需要一种方法,使人类能够监督那些在大多数任务相关技能上可能超越人类的系统。

大规模监督的挑战

大规模监督指的是监督那些在特定任务相关技能上可能超越人类的AI系统的问题。在实证研究中,主要困难在于当前的通用AI系统尚未在所有领域普遍超越人类能力。

大规模监督的实验设计

为了使用当前模型研究大规模监督,Anthropic 提出了一个实验设计,聚焦于人类专家能够成功完成,但未经辅助的人类和当前通用AI系统均失败的任务。这种方法使研究人员可以将人类专家作为正确性的基准,同时测试模型是否能帮助非专家人类达到专家水平的表现。

概念验证结果

Anthropic 使用两个问答任务进行了概念验证实验:MMLU(大规模多任务语言理解)和限时 QuALITY。该实验测试了一种大规模监督的基线策略,即人类参与者通过聊天与不可靠的大语言模型(LLM)对话助手互动。

该实验的关键发现包括:

  • 人类表现提升: 与LLM助手互动的人类参与者显著优于其独立完成的表现。
  • 系统表现提升: 人机协作的表现优于模型单独运行的表现。
  • 研究可行性: 结果表明,即使模型不可靠,也可以使用当前模型来研究大规模监督问题。

对AI安全的启示

这些发现加强了近期证据,表明大型语言模型可以有效地帮助人类完成困难任务。通过证明人类可以利用LLM提升自己在复杂任务上的表现,研究人员表明,随着AI能力的提升,人类仍有可能保持对AI系统的监督。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch