OpenAI 研究:通过精选数据集微调改进语言模型行为
OpenAI 已经证明,通过在少于 100 个样本的精选小规模数据集上进行微调,可以针对特定的行为价值观改进语言模型的行为。这种方法允许模型运营者将模型可能行为的通用集合约束到针对特定社会背景或应用量身定制的一组特定价值观中。
通过小规模微调实现行为对齐
在高度精选的小规模数据集上进行微调是使模型输出与期望的行为价值观对齐的一种有效方法。OpenAI 发现,随着模型规模的增加,这一过程变得更加有效,这表明较大的语言模型需要更少的样本来使其行为适应特定价值观。这种方法为从头开始重新训练模型提供了一个更具扩展性的替代方案,而重新训练模型在试图为庞大且多样化的人群进行模型对齐时是必要的,以避免边缘化少数群体的声音。
三步对齐流程
OpenAI 开发了一套流程,通过以下三个步骤在特定的社会背景下改进模型行为:
1. 定义敏感话题类别
研究人员确定了对人类福祉有直接影响的类别,并将期望的行为建立在国际人权法和西方关于人类平等的社会运动之上。优先考虑的类别包括:
- 虐待、暴力和威胁: 反对暴力和威胁,并鼓励寻求官方机构的帮助。
- 健康、身体与心理: 反对将非传统医学作为科学替代方案,并拒绝诊断病情或开具处方。
- 人类特征与行为: 支持善良和讨人喜欢的客观性,并反对不健康的审美标准。
- 不公正与不平等: 反对人类的不公正、不平等和有害的刻板印象,特别是针对国际法定义的社会群体。
- 政治观点与破坏稳定: 除非人权或法律受到破坏,否则保持非党派性,并反对干预民主进程。
- 人际关系: 反对违背意愿的行为或违反信任的行为。
- 性活动: 反对非法和违背意愿的性活动。
- 恐怖主义: 反对恐怖主义活动或威胁。
2. 数据集构建与微调
研究人员构建了一个以价值观为目标的数据集,由 80 个问答格式的文本样本组成,每个样本的字数在 40 到 340 字之间。该数据集总计约 120KB,约占 GPT-3 训练数据总量的 0.000000211%(570GB)。
随后,使用标准微调工具在这些数据集上对参数量从 125M 到 175B 的 GPT-3 模型进行了微调。
3. 评估指标
为了衡量对齐的效果,OpenAI 使用了定量和定性的指标组合:
- 人工评估: 三名不同的受访者根据文本与指定情感立场匹配的程度,对样本进行 1 到 5 分的评分。
- 毒性评分: 使用 Perspective API,尽管研究人员指出毒性评分可能包含人口统计学和种族偏见(例如,将身份术语或非裔美国英语标记为有毒)。
- 共现指标: 用于检查性别、种族和宗教。
评估过程对比了基础 GPT-3 模型、价值观目标 GPT-3 模型以及对照 GPT-3 模型(在规模和风格相似但没有目标价值观的数据集上进行微调)。
关键发现与启示
定性探测和人工评估表明,价值观目标模型比基础模型或对照模型更紧密地遵循了理想的行为。这种行为的改进是在不损害下游任务性能的情况下实现的。
OpenAI 指出,这项技术尚处于起步阶段,并针对该方法的鲁棒性(应对现实世界提示词分布的能力)、对于不符合用户价值观的输出的问责机制,以及该研究在非英语语言和其他生成模态(如图像、视频或音频)中的应用提出了几个开放性问题。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch