OpenAI AI 系统行为与治理框架
OpenAI 正在实施一个框架,以阐明 ChatGPT 行为的形成方式,并向更具可定制性、公众参与的治理模型转变。此举旨在降低偏见,防止权力过度集中,并确保 AI 系统符合多元的人类价值观。
塑造 AI 行为的两步过程
ChatGPT 的行为并非显式编程,而是通过两个阶段的训练过程学习得到的:预训练和微调。
预训练
在初始阶段,模型在包含广泛互联网文本的大规模数据集上进行训练。模型学习预测句子中的下一个词,从而获得语法、世界事实和推理能力。然而,这一阶段也使模型接触到源数据中存在的偏见。
微调
为了收窄系统行为,OpenAI 使用第二阶段,对模型在由人工审阅员生成的狭窄数据集上进行微调。这些审阅员遵循特定指南,对各种示例输入的模型输出进行评分。模型随后从这些反馈中进行概括,以响应大量用户输入。这是一个迭代过程,涉及 OpenAI 与审阅员之间的每周会议,以澄清指导并提升模型性能。
解决偏见与政策透明度
OpenAI 将训练过程中出现的偏见视为“错误,而非特性”,并致力于通过多项透明度和研究倡议来降低这些偏见:
- 指南披露: OpenAI 已公开了部分关于政治和争议话题的指南,明确指示审阅员不偏袒任何政治团体。
- 审阅员人口统计: 公司正努力共享审阅员的聚合人口统计信息,以识别并缓解潜在的偏见来源。
- 技术研究: OpenAI 正在研究更可控的微调过程,结合外部进展,如 Constitutional AI(宪法 AI)和基于规则的奖励。
- 指令改进: 实验室正向审阅员提供更明确的指示,涉及争议人物、主题以及潜在的偏见陷阱。
未来框架:AI 治理的三大基石
为确保 AI 的收益和影响广泛分布,OpenAI 正在制定基于三大关键基石的策略:
1. 改进默认行为
OpenAI 旨在通过降低显著和细微的偏见,使 AI 系统“开箱即用”。这包括提升系统的准确性,以防止其“凭空捏造”,并完善其拒绝机制,使其能够正确判断何时拒绝输出、何时允许输出。
2. 在广泛范围内的用户定制
OpenAI 正在开发升级功能,允许用户定制 ChatGPT 的行为以符合其个人价值观。为防止恶意使用或产生盲目放大既有信念的“阿谀 AI”,这些定制将受限于社会定义的范围。
3. 对默认设置和硬性界限的公众意见
为避免权力集中,OpenAI 正在试点征求公众对 AI 系统治理规则的意见。目前及计划中的举措包括:
- 红队测试: 寻求外部意见以测试技术的极限。
- 情境特定输入: 征求关于 AI 在特定领域(如教育)角色的反馈。
- 广泛治理: 探索公众对系统行为、部署政策以及如水印等披露机制的意见。
- 第三方审计: 与外部组织合作,对安全和政策工作进行审计。