OpenAI 模型规范:明确模型行为的框架

OpenAI 已发布了关于其模型规范方法的详细说明,模型规范是一套正式框架,定义了 AI 模型应如何遵循指令、解决冲突以及安全行为。模型规范作为预期模型行为的公开目标,使 OpenAI 能够训练、评估和改进其系统,同时为公众辩论和批评提供透明的参考点。

模型规范作为公共行为框架

模型规范旨在将模型行为从隐式的训练过程转变为明确、可读的文档。它充当内部开发的“北极星”,并为外部利益相关者提供公共参考,以了解 AI 响应的权衡和规则。

该框架是 OpenAI 更广泛安全生态系统的一部分,补充了准备框架(侧重于前沿能力风险)和 AI 弹性计划(应对社会对 AGI 的适应)。通过公开行为期望,OpenAI 旨在提升公平性——让用户能够识别并质疑偏见待遇——以及安全性,提供对有能力系统应如何行为的明确期望。

模型规范的结构组成

为处理 AI 交互的多样性,模型规范采用了多层指导,而非单一规则列表:

高级意图与公开承诺

框架以序言开始,概述了三个系统层面的目标:迭代部署模型以赋能用户、防止严重伤害以及维护 OpenAI 的运营许可。这些目标用于指导模型规范内部歧义的解决,但并非模型的自主指令。此外,规范还包括公开承诺,例如“红线原则”,承诺 OpenAI 在第一方部署中保持客观性,并且不为收入或停留时间优化响应。

指令链

指令链是解决 OpenAI、开发者和用户之间冲突指令的核心机制。它将指令分为两大类:

  • 硬性规则: 不可覆盖的边界(根或系统层面),防止灾难性风险、直接的身体伤害或非法行为。这包括“保持在范围内”和“未满18岁原则”等章节。
  • 默认值: 可覆盖的起始点,在未指定偏好时确保行为可预测。这包括指南层面的默认值(语气和风格)以及用户层面的默认值(真实性和客观性),后者需要明确指令才能覆盖,以确保透明性。

解释辅助工具

为解决“灰色地带”,规范使用:

  • 决策评估表: 用于平衡相互竞争目标的框架,例如在有效完成任务的同时最小化不可逆操作。
  • 具体示例: 提示与响应对,展示合规与不合规行为,以阐明决策边界。

实施与治理

OpenAI 澄清,模型规范是一个接口(模型应做什么),而非实现(如何训练)。它描述模型的行为,而非整个产品的功能或使用政策。

智能与显式规则的角色

OpenAI 认为,仅凭智能无法解决价值导向的决策。虽然模型可以自主解答数学题,但“有帮助性和安全性”取决于情境,需要人为定义的价值判断。显式规则防止这些决策完全交由模型,从而提供人类辩论和修订的机制。

开发与迭代

规范通过跨职能内部流程制定,涉及研究、安全、政策和法律团队,并根据公众反馈和民主意见进行迭代。OpenAI 期望规范具有“现实的理想性”,通常针对比当前模型能力提前 0-3 个月的行为目标。

衡量对齐度与识别差距

由于训练可能落后于规范更新或产生意外的概括,OpenAI 发布了 Model Spec Evals,一个基于情景的评估套件。该套件跟踪实际模型行为与规范断言之间的对齐程度。

规范的更新通常由以下因素推动:

  • 公众问题和失效模式。
  • 测试过程中发现的内部歧义。
  • 高层安全政策的变更。
  • 新能力的出现,例如多模态交互和自主代理。

规范内容的设计原则

为确保框架可操作,OpenAI 遵循若干写作原则:

  • 清晰与精确: 避免模糊语言,提供关于如何解决冲突的明确指导(例如,为了温暖而优先考虑真实性而非“善意的谎言”)。
  • 实质性规则: 确保规则足够明确,使不同读者能够就响应是否合规达成一致。
  • 高信噪比示例: 使用能够突出最困难冲突和决策边界的示例。

Sources