OpenAI Model Spec 更新
OpenAI 已发布 Model Spec 的重大更新,Model Spec 是一份治理文件,定义了其 AI 模型的预期行为。此次更新强调可定制性、透明度和知识自由,使用户和开发者能够在不受任意限制的情况下探索和创造,同时保持必要的安全防护措施以防止现实世界的伤害。
核心目标和指挥链
Model Spec 通过结构化的“指挥链”平衡实用性、安全性和满足用户需求之间的竞争目标。该框架确保模型按照特定顺序优先处理指令——平台(OpenAI)、开发者和用户——从而在平台级别的边界内实现高度定制。
该规范围绕以下几个关键原则组织:
- 指挥链: 优先考虑来自平台的指令,然后是开发者,最后是用户,确保在保持平台级别规则的同时,允许用户/开发者对大多数指南进行覆盖。
- 共同追求真相: 关注客观性和避免议程。模型被设计为高诚信助手,能够澄清假设并提供关键反馈,而不引导用户。
- 做出最佳工作: 为事实准确性、创造力和程序化实用性设定基准标准。
- 保持在范围内: 定义拒绝的全面边界,详细说明模型应出于何种具体原因拒绝请求,以避免促成伤害或滥用。
- 亲和易近: 设定默认的对话风格为温暖、共情和乐于助人,尽管可以根据用户需求进行调整。
- 使用适当的风格: 提供关于格式和交付的指导(例如,项目符号、简洁代码),以确保清晰和可用性。
对知识自由的承诺
更新后的 Model Spec 明确保护知识自由,确保 AI 可用于探索和辩论有争议或具有挑战性的话题,而不受任意限制。
这一理念融入了“保持在范围内”和“共同追求真相”原则。虽然模型将继续拒绝导致重大伤害的请求——例如提供制造炸弹的说明或侵犯个人隐私——但鼓励对文化或政治敏感的问题提供深思熟虑的答案,而不推广特定议程。
衡量遵循程度和进展
OpenAI 已实施一个测试框架,以衡量模型遵循 Model Spec 原则的程度,使用由 AI 和专家人工审查结合生成的挑战提示集。
初步结果表明,与 2024 年 5 月使用的系统相比,模型遵循程度有显著提升。OpenAI 将此进展主要归因于增强的一致性,尽管部分归因于政策更新。为了继续这一迭代过程,OpenAI 正在对大约 1,000 名个体进行试点研究,以审查模型行为和提出的规则。
开源和公共领域发布
为了鼓励协作和行业范围内的采用,OpenAI 已将当前版本的 Model Spec 在知识共享 CC0 许可证下发布到公共领域。
开发者和研究者可以自由地改进和基于 Spec 进行构建。此外,OpenAI 已开源用于衡量遵循程度的评估提示,并计划在未来发布更多代码、工件和工具,用于 Spec 的评估和一致性。这些资源可在专门的 GitHub 仓库中获取。
未来迭代
OpenAI 将基于研究、实际部署和社区反馈继续对 Model Spec 进行迭代。未来的更新将直接在 model-spec.openai.com 进行跟踪,而不是通过单独的博客文章。
Sources
- OriginalSharing the latest Model Spec