OpenAI 推出 GPT-6 Sol 和 Luna

TL;DR

OpenAI 发布了 GPT‑6 Sol 和 GPT‑6 Luna,这是 GPT‑6 Astra 的成本效益更高的继任者,相比 GPT‑5.6 的 API 价格减半,并在专业任务、事实准确性、编程和计算机使用工作负载方面保持高性能。

GPT‑6 系列扩展概览

OpenAI 推出了 GPT‑6 Sol 和 GPT‑6 Luna,以补充旗舰模型 GPT‑6 Astra。这三个模型采用相同的训练方法,但 Sol 和 Luna 经过优化,可实现更低延迟和更低推理成本。缓存和推理基础设施的改进使价格相比 GPT‑5.6 促销价降低了 50 %,让先进 AI 更易于用于日常应用。

API 定价下调

模型 输入价格(每 M 标记) 输出价格(每 M 标记) 相对降幅
GPT‑6 Sol $4 → $2 $20 → $10 50 % 更便宜
GPT‑6 Luna $0.20 → $0.10 $1.20 → $0.50 50 % 更便宜

价格按每 1 百万标记计算。GPT‑6 Astra 仍为需要最佳结果的用户首选顶级模型。

专业工作性能

关键结果

GPT‑6 Sol 在 AutomationBench 基准测试中表现优于 Claude Opus 5,但每任务成本仅为 Opus 5 的 9 %;GPT‑6 Luna 在成本降低 58 % 的情况下,相比其前代模型提升了 5.4 个百分点。

详细对比

  • AutomationBench 1.0.6 评估 AI 代理在 47 个工具上的端到端工作流表现。GPT‑6 Sol(xhigh effort)得分为 33.2 %,每任务成本为 $0.27,在得分和成本上均优于 GPT‑6 Astra(low effort)和 Claude Opus 5(max effort)。
  • 在 Agents’ Last Exam 上,GPT‑6 Sol(max effort)得分为 56.4 %,超越 Claude Opus 5,同时每任务成本降低 60 %。

事实准确性提升

在 OpenAI 内部的事实准确性基准测试中,GPT‑6 Sol 的事实性错误数量约为 GPT‑5.6 Sol 的一半,接近 Astra 的可靠性,但成本仅为一小部分。GPT‑6 Luna 也表现出显著进步,在高努力级别运行时,其事实性与 GPT‑5.6 Sol 相当,但成本仅为约百分之一。

编程能力与成本效率

关键结果

在 FrontierCode 和 DeepSWE v1.1 基准测试中,GPT‑6 Sol 提供的编程质量与顶级竞争对手模型相当,同时每任务成本最高可降低 80 %。

基准详情

  • FrontierCode:GPT‑6 Sol 超越 GPT‑5.6 Sol,并以更低成本达到与 Claude Fable 5.1(xhigh effort)相当的水平。
  • DeepSWE v1.1:GPT‑6 Sol(max effort)得分为 68.8 %,与 Claude Fable 5 的最佳得分仅相差 1.1 个百分点,但每任务成本降低约 80 %。GPT‑6 Luna(max effort)得分为 66.6 %,与 Claude Opus 5 和 Claude Fable 5 在中等努力水平下的表现相当,但每任务成本降低 93 %–96 %。

计算机使用性能

GPT‑6 Sol(xhigh effort)在 OSWorld 2.0 离线测试中得分为 60.5 %,与 Claude Opus 5(medium effort)相当,但成本降低约 80 %。GPT‑6 Luna(max effort)超越 GPT‑5.6 Sol(medium effort),同时仅使用其十分之一的成本。

增强的协作风格

Sol 和 Luna 均继承了 Astra 的优化沟通风格:解释更清晰,术语更少,无关细节更少,答案略短但不牺牲内容。示例对比显示,Sol 提供的回应比其 GPT‑5.6 前代模型更审慎、更精确。

代理的提示缓存进展

OpenAI 引入了更高的默认缓存命中率,并对缓存输入标记读取提供 90 % 折扣。新增开发者工具包括:

  • 提示缓存仪表板,用于可视化缓存使用情况。
  • 诊断工具,用于识别未利用的缓存机会。
  • 对 推理努力 和 工具可用性 的控制,可保留缓存上下文。
  • 显式断点,用于定义缓存提示前缀。 GitHub 报告称,这些更改使数十亿请求中新鲜提示标记处理的比例降低了超过 50 %,显著加快了 Copilot 的响应速度。

对齐进展

Sol 和 Luna 建立在 Astra 的对齐改进之上。内部评估显示,与 GPT‑5.6 模型相比,其在编程任务中误导性声明的发生率更低。报告的指标针对刻意具有挑战性的场景,不代表典型使用中的故障率。完整结果请参见 GPT‑6 Astra 系统卡片。

可用性

  • ChatGPT Work 和 Codex:GPT‑6 Sol 和 GPT‑6 Luna 已对 Plus、Pro、Business、Enterprise 和 Edu 套餐开放。
  • 免费用户和 Go 用户:可通过桌面应用访问 GPT‑6 Luna。
  • API:可通过 gpt-6-sol 和 gpt-6-luna 调用。
  • ChatGPT:将全天逐步推出;若模型尚未显示,用户可能需要重试。

所有评估均在 OpenAI 的研究环境或通过 API 执行;生产版 ChatGPT 可能因系统提示和工具差异而有所不同。竞争对手得分来自公开报告。

Sources