OpenAI 集体对齐与模型规范更新

OpenAI 发起了一项集体对齐研究计划,将公众偏好纳入其模型规范(Model Spec),即管理默认 AI 行为的指南集合。此举旨在通过反映广泛的全球价值观和优先事项,确保 AGI 造福人类,而不是依赖单一机构来定义理想行为。

将公众输入整合到模型规范中

OpenAI 通过收集来自 19 个国家的 1,000 多人的意见,更新了其模型规范。该过程通过自动化和人工审查循环的组合,将全球偏好转化为可操作的指南。虽然多数参与者的偏好与现有规范一致,但一些分歧促使对措辞进行澄清或对核心原则提出修改建议。

反馈收集过程

与直接审阅规范文档不同,参与者审阅了预先挑选的提示和在价值敏感领域的回复,这些领域的理想行为往往具有主观性。

  • Methodology: 参与者为每个提示排名四个可能的完成(其中三个涵盖不同的现实观点,一个由 GPT-4o 生成)。
  • Scope: 每位参与者审阅 5 到 20 条提示,提供排名、理由,并依据预先编写的评分标准进行打分。
  • Demographics: 参与者来自 19 个国家(最初来自 50 多个国家),包括美国、墨西哥、南非、荷兰、智利、英国、印度、肯尼亚和日本。

将偏好转化为指南

OpenAI 采用了两条互补的循环,将原始参与者数据转化为模型规范提案:

  1. Fully-Automated Loop: 一个推理模型识别参与者与 Model Spec RankerMSR——负责根据当前规范对回复进行排序的模型)之间的分歧模式。自动化循环提出修改,以提升与大众的对齐程度。
  2. Human-First Loop: 研究人员整体审阅人类偏好并提出更新,然后由推理模型验证,以判断大众的理由是否支持该修改的意图。

OpenAI 指出,人工优先循环捕捉到了诸如间接自杀意图等细微差别,而自动化循环则在可扩展性方面表现更佳。

采纳与拒绝

模型规范的提议更改需经过内部审查,在此过程中会将大众偏好与安全政策、平台风险以及部署约束进行权衡。

未被采纳的更改

  • Tailored Political Content: 许多参与者希望获得更个性化的政治内容。OpenAI 因大规模个性化政治定向的风险而拒绝了此请求。
  • Erotica for Consenting Adults: 虽然大量参与者支持开启成人自愿的情色内容,但 OpenAI 表示在安全部署之前仍需进一步的研究和产品工作。

技术限制与未来方向

OpenAI 承认此早期实验存在若干局限性:

  • Selection Bias: 参与者样本相对于全球人口规模较小,且仅限于阅读英文的用户。
  • Model Spec Ranker (MSR) Bias: 由于规范本身描述不够明确,MSR 对规则的解释可能受到其训练数据的影响,导致潜在的解释偏差。
  • Legitimacy and Validation: 流程的自动化部分可能更难被人类理解,且最终提案未直接回馈给参与者进行验证。
  • Trade-off Analysis: 参与者在孤立的情境下评判行为,未对相互竞争的原则之间的权衡(例如情色与儿童安全)进行综合考量。

结论

此集体对齐过程是一个端到端系统的首次迭代,旨在提取并融合多元的人类价值观到 AI 默认行为中。OpenAI 已在 HuggingFace 上发布了公开输入数据集,以促进 AI 生态系统的进一步研究。未来工作将侧重于扩大过程规模,纳入更多视角,并可能定义多套反映不同价值体系的默认设置。

Sources