使用 GPT-4 进行内容审核
OpenAI 正在利用 GPT-4 自动化和细化内容审核,将开发和自定义内容政策所需的时间从数月缩短到数小时。这种方法将人工审核员的角色从手动内容过滤转移到高层次的政策细化以及复杂边缘情况的处理。
使用 GPT-4 加速政策开发
GPT-4 通过自动化政策指南的标注和测试,实现了内容审核分类器的快速创建和部署。与依赖缓慢的人工内容筛选不同,政策专家使用与 LLM 的迭代循环来细化规则:
- 黄金集合创建:政策专家识别少量示例并根据书面政策为其分配标签。
- 模型标注:GPT-4 读取政策并对同一数据集分配标签,而不查看人工答案。
- 差异分析:专家检查 GPT-4 的判断与人工标签之间的差异。通过要求 GPT-4 提供其标签背后的推理,专家可以识别政策定义中的歧义并提供进一步澄清。
此循环会重复进行,直到政策质量令人满意为止,此时将把精炼后的政策转化为用于大规模部署的分类器。
通过模型蒸馏扩大审核规模
为了高效管理海量数据,OpenAI 使用 GPT-4 的预测来微调更小、更高效的模型。这使得系统在进行实时内容审核所需的规模和速度下,仍能保持 GPT-4 的复杂推理能力。
未来增强和风险检测
OpenAI 正在探索几种技术方法,以提高审核预测的质量和新风险的发现:
- 推理改进:融入思维链推理和自我批评以提高预测准确性。
- 主动风险识别:使用模型基于高层次的危害描述(受 Constitutional AI 启发)来识别潜在有害内容。这些发现随后用于更新现有政策或为全新风险领域创建政策。
人机回路和偏差缓解
人工监督在审核过程中仍然至关重要,以减轻 AI 训练偏差带来的风险。由于语言模型的判断可能容易受到不希望的偏差影响,OpenAI 维持一个人机回路系统来监控、验证和优化输出。此策略使人力资源能够从重复的过滤任务中解脱出来,转向持续政策改进所需的复杂边缘情况。