OpenAI 推出 GPT-6 Sol 和 Luna
TL;DR
OpenAI 发布了 GPT‑6 Sol 和 GPT‑6 Luna,这是 GPT‑6 Astra 的成本效益更高的继任者,相比 GPT‑5.6 的 API 价格减半,并在专业任务、事实准确性、编程和计算机使用工作负载方面保持高性能。
GPT‑6 系列扩展概览
OpenAI 推出了 GPT‑6 Sol 和 GPT‑6 Luna,以补充旗舰模型 GPT‑6 Astra。这三个模型采用相同的训练方法,但 Sol 和 Luna 经过优化,可实现更低延迟和更低推理成本。缓存和推理基础设施的改进使价格相比 GPT‑5.6 促销价降低了 50 %,让先进 AI 更易于用于日常应用。
API 定价下调
| 模型 | 输入价格(每 M 标记) | 输出价格(每 M 标记) | 相对降幅 |
|---|---|---|---|
| GPT‑6 Sol | $4 → $2 | $20 → $10 | 50 % 更便宜 |
| GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50 % 更便宜 |
价格按每 1 百万标记计算。GPT‑6 Astra 仍为需要最佳结果的用户首选顶级模型。
专业工作性能
关键结果
GPT‑6 Sol 在 AutomationBench 基准测试中表现优于 Claude Opus 5,但每任务成本仅为 Opus 5 的 9 %;GPT‑6 Luna 在成本降低 58 % 的情况下,相比其前代模型提升了 5.4 个百分点。
详细对比
- AutomationBench 1.0.6 评估 AI 代理在 47 个工具上的端到端工作流表现。GPT‑6 Sol(xhigh effort)得分为 33.2 %,每任务成本为 $0.27,在得分和成本上均优于 GPT‑6 Astra(low effort)和 Claude Opus 5(max effort)。
- 在 Agents’ Last Exam 上,GPT‑6 Sol(max effort)得分为 56.4 %,超越 Claude Opus 5,同时每任务成本降低 60 %。
事实准确性提升
在 OpenAI 内部的事实准确性基准测试中,GPT‑6 Sol 的事实性错误数量约为 GPT‑5.6 Sol 的一半,接近 Astra 的可靠性,但成本仅为一小部分。GPT‑6 Luna 也表现出显著进步,在高努力级别运行时,其事实性与 GPT‑5.6 Sol 相当,但成本仅为约百分之一。
编程能力与成本效率
关键结果
在 FrontierCode 和 DeepSWE v1.1 基准测试中,GPT‑6 Sol 提供的编程质量与顶级竞争对手模型相当,同时每任务成本最高可降低 80 %。
基准详情
- FrontierCode:GPT‑6 Sol 超越 GPT‑5.6 Sol,并以更低成本达到与 Claude Fable 5.1(xhigh effort)相当的水平。
- DeepSWE v1.1:GPT‑6 Sol(max effort)得分为 68.8 %,与 Claude Fable 5 的最佳得分仅相差 1.1 个百分点,但每任务成本降低约 80 %。GPT‑6 Luna(max effort)得分为 66.6 %,与 Claude Opus 5 和 Claude Fable 5 在中等努力水平下的表现相当,但每任务成本降低 93 %–96 %。
计算机使用性能
GPT‑6 Sol(xhigh effort)在 OSWorld 2.0 离线测试中得分为 60.5 %,与 Claude Opus 5(medium effort)相当,但成本降低约 80 %。GPT‑6 Luna(max effort)超越 GPT‑5.6 Sol(medium effort),同时仅使用其十分之一的成本。
增强的协作风格
Sol 和 Luna 均继承了 Astra 的优化沟通风格:解释更清晰,术语更少,无关细节更少,答案略短但不牺牲内容。示例对比显示,Sol 提供的回应比其 GPT‑5.6 前代模型更审慎、更精确。
代理的提示缓存进展
OpenAI 引入了更高的默认缓存命中率,并对缓存输入标记读取提供 90 % 折扣。新增开发者工具包括:
- 提示缓存仪表板,用于可视化缓存使用情况。
- 诊断工具,用于识别未利用的缓存机会。
- 对 推理努力 和 工具可用性 的控制,可保留缓存上下文。
- 显式断点,用于定义缓存提示前缀。 GitHub 报告称,这些更改使数十亿请求中新鲜提示标记处理的比例降低了超过 50 %,显著加快了 Copilot 的响应速度。
对齐进展
Sol 和 Luna 建立在 Astra 的对齐改进之上。内部评估显示,与 GPT‑5.6 模型相比,其在编程任务中误导性声明的发生率更低。报告的指标针对刻意具有挑战性的场景,不代表典型使用中的故障率。完整结果请参见 GPT‑6 Astra 系统卡片。
可用性
- ChatGPT Work 和 Codex:GPT‑6 Sol 和 GPT‑6 Luna 已对 Plus、Pro、Business、Enterprise 和 Edu 套餐开放。
- 免费用户和 Go 用户:可通过桌面应用访问 GPT‑6 Luna。
- API:可通过
gpt-6-sol和gpt-6-luna调用。 - ChatGPT:将全天逐步推出;若模型尚未显示,用户可能需要重试。
所有评估均在 OpenAI 的研究环境或通过 API 执行;生产版 ChatGPT 可能因系统提示和工具差异而有所不同。竞争对手得分来自公开报告。
Sources
- OriginalIntroducing GPT-6 Sol and Luna