OpenAI 生物威胁评估:构建早期预警系统
OpenAI 开发了一种新的评估方法,作为检测 AI 模型何时可能显著提升生物威胁制造风险的“警戒线”。该研究旨在确定获取 GPT-4 是否会为恶意行为者提供超出互联网已有信息的危险信息。
研究设计与方法论
为了评估 AI 对生物风险信息获取的影响,OpenAI 进行了一项包含 100 名人类参与者的研究,分为两个群体:50 名生物学专家(拥有专业湿实验室经验的博士)和 50 名学生水平的参与者(至少修过一门大学层次的生物学课程)。
实验组
每个群体的参与者被随机分配到以下两组之一:
- 对照组: 仅访问互联网。
- 实验组: 同时访问 GPT-4 和互联网。
评估范围
要求参与者完成涵盖生物威胁创建过程五个阶段的任务:
- 构思
- 获取
- 放大
- 配方
- 释放
性能指标
Gryphon Scientific 的专家评分员使用客观评分标准,对回答在 1-10 分尺度上进行评分,涵盖三个主要指标:
- 准确性: 参与者是否包含了完成任务的所有关键步骤。
- 完整性: 参与者是否包含了所有隐含信息和必要细节。
- 创新性: 参与者是否设计了新颖的方法,例如规避 DNA 合成筛查的防护措施。
此外,研究还跟踪了 完成时间 和 自评难度。
关键发现
访问 GPT-4 带来了任务表现的轻微提升,但这些结果未达到统计显著性。
性能提升
- 准确性: 与仅使用互联网的基线相比,专家的平均分提升了 0.88,学生提升了 0.25。
- 完整性: 专家的提升为 0.82,学生的提升为 0.41。
值得注意的观察
- 弥合差距: 在放大和配方任务中,使用语言模型使学生的表现提升至专家的基线水平。
- 信息可得性: 研究发现,包括生物威胁创建的逐步方法在内的危险内容,已经可以通过常规互联网搜索相对容易地获取。
- 物理瓶颈: OpenAI 指出,仅有信息获取不足以制造威胁;物理限制,如湿实验室的使用权以及微生物学和病毒学的专业专长,仍是主要瓶颈。
方法论洞察与安全性
OpenAI 实施了特定的设计原则,以确保评估能够激发模型的全部能力:
- 人机交互: 该研究使用人类参与者而非自动化基准测试,因为人类可以定制提示并纠正错误,以更好地从模型中提取信息。
- 能力引导: 参与者接受了使用大型语言模型的最佳实践培训,以避免失效模式。专家们获得了一个定制的、仅用于研究的 GPT-4 版本,能够对生物风险问题作出回答而不拒绝。
- 安全协议: 由 Gryphon Scientific 主导的培训涵盖了关注的双重用途研究(DURC)以及严格保密,以防止产生信息危害。
生物风险评估的未来方向
OpenAI 确认了在为 AI 模型设定有效安全阈值时的若干挑战:
- 定义“警戒线”: 目前尚不清楚何种程度的信息获取提升才构成风险的显著增加。
- 统计分析: OpenAI 认为,在风险评估中,假阴性(漏掉风险)的代价高于假阳性,需要采用优先捕获风险而非传统最小化 p‑hacking 的统计方法。