OpenAI o1-mini 发布说明
OpenAI 已推出 o1-mini,这是一款专门用于 STEM 领域的推理模型,能够在成本更低、速度更快的情况下实现与完整 o1 系列相当的高性能。该模型面向需要复杂推理但不需要广泛通用世界知识的应用场景。
成本与可用性
o1-mini 对 Tier 5 API 用户开放,费用比 o1-preview 低 80%。对于 ChatGPT Plus、Team、Enterprise 和 Edu 用户,o1-mini 可作为 o1-preview 的替代方案,提供更高的速率限制和更低的延迟。
STEM 推理性能
o1-mini 是一个更小的模型,在预训练阶段针对 STEM 推理进行优化,并使用与完整 o1 模型相同的高算力强化学习(RL)流水线进行训练。虽然它缺乏高容量模型的广泛世界知识,但在特定技术领域能够实现相当的推理性能。
数学与编码
在技术基准测试中,o1-mini 展示了与完整 o1 模型竞争的性能,并在多个方面超越了 o1-preview:
- 数学: 在美国高中 AIME 数学竞赛中,o1-mini 获得 70.0% 的得分,约位列美国高中学生前 500 名。该成绩优于 o1-preview(44.6%),并与 o1(74.4%)相竞争。
- 编码: 在 Codeforces 上,o1-mini 达到 1650 的 Elo,位列竞争程序员的第 86 百分位。该分数高于 o1-preview(1258),并与 o1(1673)相竞争。该模型在 HumanEval 基准以及高中水平的网络安全夺旗(CTF)挑战中也表现出色。
通用 STEM 与人类偏好
o1-mini 在需要推理的学术基准(如 MATH-500 和 GPQA(科学))上优于 GPT-4o。然而,在 GPQA 上它落后于 o1-preview,并且由于非 STEM 事实知识有限,在 MMLU 上表现不如 GPT-4o。
人类偏好评估显示,在以推理为主的领域,用户更倾向于 o1-mini 而非 GPT-4o,但在语言为主的任务上则不具优势。
模型速度与延迟
o1-mini 的响应时间显著快于更大的模型。在一次单词推理测试中,o1-mini 获得正确答案的速度约为 o1-preview 的 3-5 倍,而 GPT-4o 未能正确回答该问题。
安全性与鲁棒性
o1-mini 使用与 o1-preview 相同的对齐和安全技术。使用 StrongREJECT 数据集进行的内部评估显示,o1-mini 的越狱鲁棒性比 GPT-4o 高出 59%。
| 指标 | GPT-4o | o1-mini |
|---|---|---|
| % 对有害提示的安全完成拒绝率(标准) | 0.99 | 0.99 |
| % 对有害提示的安全完成率(挑战性:越狱与边缘案例) | 0.714 | 0.932 |
| % 对良性边缘案例的合规率 | 0.91 | 0.923 |
| Goodness@0.1 StrongREJECT 越狱评估 | 0.22 | 0.83 |
| 人工来源的越狱评估 | 0.77 | 0.95 |
限制
由于 o1-mini 专注于 STEM,其在非 STEM 主题(包括人物传记、日期和一般常识)方面的事实知识仅相当于诸如 GPT-4o mini 等较小的模型。OpenAI 计划在后续版本中解决这些限制,并探索向其他模态和专长的扩展。
Sources
- OriginalOpenAI o1-mini