OpenAI o1-mini 发布说明

OpenAI 已推出 o1-mini,这是一款专门用于 STEM 领域的推理模型,能够在成本更低、速度更快的情况下实现与完整 o1 系列相当的高性能。该模型面向需要复杂推理但不需要广泛通用世界知识的应用场景。

成本与可用性

o1-mini 对 Tier 5 API 用户开放,费用比 o1-preview 低 80%。对于 ChatGPT Plus、Team、Enterprise 和 Edu 用户,o1-mini 可作为 o1-preview 的替代方案,提供更高的速率限制和更低的延迟。

STEM 推理性能

o1-mini 是一个更小的模型,在预训练阶段针对 STEM 推理进行优化,并使用与完整 o1 模型相同的高算力强化学习(RL)流水线进行训练。虽然它缺乏高容量模型的广泛世界知识,但在特定技术领域能够实现相当的推理性能。

数学与编码

在技术基准测试中,o1-mini 展示了与完整 o1 模型竞争的性能,并在多个方面超越了 o1-preview:

  • 数学: 在美国高中 AIME 数学竞赛中,o1-mini 获得 70.0% 的得分,约位列美国高中学生前 500 名。该成绩优于 o1-preview(44.6%),并与 o1(74.4%)相竞争。
  • 编码: 在 Codeforces 上,o1-mini 达到 1650 的 Elo,位列竞争程序员的第 86 百分位。该分数高于 o1-preview(1258),并与 o1(1673)相竞争。该模型在 HumanEval 基准以及高中水平的网络安全夺旗(CTF)挑战中也表现出色。

通用 STEM 与人类偏好

o1-mini 在需要推理的学术基准(如 MATH-500 和 GPQA(科学))上优于 GPT-4o。然而,在 GPQA 上它落后于 o1-preview,并且由于非 STEM 事实知识有限,在 MMLU 上表现不如 GPT-4o。

人类偏好评估显示,在以推理为主的领域,用户更倾向于 o1-mini 而非 GPT-4o,但在语言为主的任务上则不具优势。

模型速度与延迟

o1-mini 的响应时间显著快于更大的模型。在一次单词推理测试中,o1-mini 获得正确答案的速度约为 o1-preview 的 3-5 倍,而 GPT-4o 未能正确回答该问题。

安全性与鲁棒性

o1-mini 使用与 o1-preview 相同的对齐和安全技术。使用 StrongREJECT 数据集进行的内部评估显示,o1-mini 的越狱鲁棒性比 GPT-4o 高出 59%。

指标 GPT-4o o1-mini
% 对有害提示的安全完成拒绝率(标准) 0.99 0.99
% 对有害提示的安全完成率(挑战性:越狱与边缘案例) 0.714 0.932
% 对良性边缘案例的合规率 0.91 0.923
Goodness@0.1 StrongREJECT 越狱评估 0.22 0.83
人工来源的越狱评估 0.77 0.95

限制

由于 o1-mini 专注于 STEM,其在非 STEM 主题(包括人物传记、日期和一般常识)方面的事实知识仅相当于诸如 GPT-4o mini 等较小的模型。OpenAI 计划在后续版本中解决这些限制,并探索向其他模态和专长的扩展。

Sources