OpenAI o1-preview 发布说明 / 新功能
OpenAI 推出了 o1 系列,这是一类新型 AI 模型,旨在在回应之前花更多时间进行“思考”。这种向以推理为中心的架构转变,使这些模型能够比以往版本解决在科学、编码和数学方面显著更困难的问题。
推理能力与性能
OpenAI o1 模型经过训练,以完善其思考过程、识别错误,并在给出最终答案前尝试不同策略。这种方法在技术领域带来了显著的性能提升:
- 数学: 在国际数学奥林匹克(IMO)资格考试中,推理模型得分为 83%,而 GPT-4o 为 13%。
- 编码: 这些模型在 Codeforces 竞赛中达到了第 89 百分位。
- 科学: 在物理、化学和生物学等具有挑战性的基准任务中,下一代模型的表现与博士生相当。
对于许多常见任务,GPT-4o 在短期内仍更为强大,因为 o1-preview 目前缺少网页浏览、文件上传和图像支持等功能。
安全性与对齐训练
OpenAI 实施了一种新的安全训练方法,利用模型自身的推理能力来遵循对齐指南。通过在上下文中推理安全规则,模型能够更有效地应用这些规则。
对“越狱”(尝试规避安全规则)的内部测试显示出显著提升:o1-preview 模型在 0-100 的评分尺度上得分 84,而 GPT-4o 为 22。
为支持这些能力,OpenAI 已整合以下治理措施:
- 准备框架: 严格的测试和评估。
- 外部合作: 与美国和英国 AI 安全研究所签署正式协议,包括向其提供模型研究版本的提前访问。
- 内部审查: 由安全与安保委员会进行的董事会级别审查流程。
模型变体:o1-preview 与 o1-mini
OpenAI 正在发布推理系列的两个版本,以在性能和效率之间取得平衡:
- OpenAI o1-preview: 主要的推理模型,旨在处理复杂的多步骤问题。
- OpenAI o1-mini: 更快、更廉价的替代方案,专为编码优化。其成本比 o1-preview 低 80%,适用于需要推理但不需要广泛世界知识的应用。
可用性与访问
o1 系列的访问正在不同层级中逐步推出:
- ChatGPT Plus 与 Team: 通过模型选择器访问 o1-preview 和 o1-mini。截止 2024 年 9 月 17 日,o1-preview 的速率限制为每周 50 次查询,o1-mini 为每日 50 次查询。
- ChatGPT Enterprise 与 Edu: 访问在首次 9 月 12 日发布后一周开始。
- 开发者: API 访问面向使用层级 5 的用户,初始速率限制为 20 RPM。当前 API 不支持函数调用、流式传输或系统消息。
- 免费用户: OpenAI 计划向所有 ChatGPT 免费用户提供 o1-mini 访问。
未来路线图
OpenAI 将继续在 GPT 系列的同时开发 o1 系列。计划对 o1 模型的改进包括加入网页浏览、文件上传和图像上传功能。
Sources
- OriginalIntroducing OpenAI o1