OpenAI GPT‑6 Sol 和 Luna 发布:价格下调 50% 并性能概览

TL;DR

OpenAI 发布了 GPT‑6 Sol 和 GPT‑6 Luna,两款模型的定价均比其 GPT‑5.6 前代产品低 50 %,同时在专业任务表现、事实准确性、编码能力以及计算机使用效率方面均有可衡量的提升。


定价突破

模型 输入价格(每 100 万 token) 输出价格(每 100 万 token) 相对降幅
GPT‑6 Sol $2(从 $4 下调) $10(从 $20 下调) 50 %
GPT‑6 Luna $0.10(从 $0.20 下调) $0.50(从 $1.20 下调) 50 %

OpenAI 表示,这些降价已直接传递给 API 用户和 ChatGPT 订阅层级。更低的费率旨在使先进 AI 在日常自动化和大规模应用中更具可行性。


专业任务表现

  • AutomationBench(47 工具工作流基准):
    • GPT‑6 Sol(极高努力)的表现优于 Claude Opus 5(最大努力),但每项任务成本仅为 Opus 5 的 9 %。
    • GPT‑6 Luna(高努力)相比其前代模型提升 5.4 pp,成本降低 58 %。
  • Agents’ Last Exam(复杂工作流评估):GPT‑6 Sol(最大努力)得分为 56.4 %,在 60 % 低成本下达到与 Claude Opus 5 相同的质量。

这些结果表明,Sol 和 Luna 在商业流程自动化领域主导了成本–智能前沿。


事实准确性提升

OpenAI 内部的事实性测试——基于用户标记错误的真实对话——报告称:

  • GPT‑6 Sol 的事实性错误数量约为 GPT‑5.6 Sol 的 一半,接近 Astra 级别的可靠性。
  • GPT‑6 Luna 在更高推理努力下运行时,事实性表现与 GPT‑5.6 Sol 相当,但成本仅为 ≈1 %。

评估指出,测试集偏向于易出错的查询,因此在典型使用中的绝对错误率更低。


编码基准测试

  • FrontierCode(代码变更就绪度):GPT‑6 Sol 超越 GPT‑5.6 Sol,并以远低于价格匹配 Claude Fable 5.1(极高努力)的表现。
  • DeepSWE v1.1(软件工程任务):GPT‑6 Sol(最大努力)得分为 68.8 %,与 Claude Fable 5 最佳得分仅差 1.1 pp,但每任务成本低 ≈80 %。
  • GPT‑6 Luna(最大努力)得分为 66.6 %,与 Claude Opus 5 相当,且每任务成本低 93 %。

社区评论指出体验不一:部分用户认为 Luna 是“自由发挥”的配对编程助手,而另一些用户报告其编码得分相比 5.6 版本有所下降。


计算机使用效率

  • OSWorld 2.0 离线(长周期计算机使用工作流):GPT‑6 Sol(极高)以 ≈80 % 的成本降低,达到与 Claude Opus 5(中等)相当的性能。GPT‑6 Luna(最大)以 十分之一的成本,超越 GPT‑5.6 Sol(中等)。

对齐与沟通风格

OpenAI 声称 Sol 和 Luna 继承了 Astra 的对齐改进,表现出更低的误导性编码声明率。定性示例显示其语气更简洁、无术语化,且奇异性表达更少。


提示缓存增强

  • 新增的 Prompt Caching Dashboard 和诊断工具,让开发者可查看缓存命中率和遗漏机会。
  • 调整 推理努力 或 工具可用性 现在可保留缓存前缀,使缓存输入 token 读取最多可享受 90 % 折扣。
  • GitHub 报告在数百亿次请求中,新鲜 token 处理量 >50 % 降低,显著加快 Copilot 响应速度。

可用性

  • ChatGPT Work 和 Codex:Sol 和 Luna 已对 Plus、Pro、Business、Enterprise 和 Edu 用户上线。
  • 免费/Go 用户可通过桌面应用访问 Luna。
  • API 标识符:gpt-6-sol 和 gpt-6-luna。
  • ChatGPT 中逐步上线;模型可能在当天稍晚出现。

社区观点(精选 HN 评论)

  • 定价影响 – 许多评论者(如 @simonw、@Cu3PO42)强调 Luna 的“离谱” $0.10/​M‑输入价格是颠覆性的。
  • 模型选择 – 用户争论何时应优先选择 Sol、Luna 或 Astra;有人指出更高推理层级可弥补基础模型尺寸较小的问题。
  • 性能波动 – 多位用户报告 Luna 的编码得分略低于 5.6 版,而 Sol 在极高努力下表现强劲,但因推理步骤增加而可能更慢。
  • 缓存工具 – 开发者如 @apitman 在修复损坏代理后,称赞新缓存仪表板。
  • 竞争格局 – 评论者将 OpenAI 的价格战与 Anthropic 的 Opus 5.5 对比,强调 OpenAI 透明的基准表格。

总结

OpenAI 的 GPT‑6 Sol 和 Luna 通过 价格减半且保留大部分 Astra 智能,扩展了 GPT‑6 系列。基准测试显示其在自动化、事实性、编码和计算机使用任务中均具备更优的成本效率,而新的缓存工具进一步降低了运营成本。此次发布使 OpenAI 在与 Anthropic 及其他前沿模型的竞争中占据有利地位,尤其适用于高吞吐量的开发工作流。

Sources

相关