OpenAI GPT‑6.1 Sol 发布:以五分之一的成本实现接近 Astra 的性能

TL;DR

OpenAI 推出了 GPT‑6.1 Sol,该模型在编程、计算机使用和专业工作基准测试中表现出与 GPT‑6 Astra 相当或接近的能力,而价格仅为 Astra 输入输出 token 价格的五分之一左右。这一公告在 Hacker News 上引发了关于定价策略、模型发布速度以及新模型与 Opus 5.5 及早期 Sol 版本对比的热烈讨论。


什么是 GPT‑6.1 Sol

  • 接近 Astra 的智能:旨在缩小在智能体编程、计算机使用和复杂专业任务方面与 GPT‑6 Astra 的差距。
  • 成本降低:缓存输入 token 的价格为 每百万 token 0.10 美元 —— 比标准输入价格优惠 95%,比 GPT‑6 Sol 的缓存价格便宜 50%。标准 API 定价为:输入每百万 2 美元,缓存输入每百万 0.10 美元,输出每百万 10 美元。
  • 可用性:ChatGPT Work 和 Codex 的 Plus、Pro、Business、Enterprise 和 Edu 用户可立即使用。可通过 API gpt-6.1-sol 访问。超快 (Ultrafast) 模式(token 生成速度最高提升 8 倍)将在未来几天内推出。

基准测试亮点

任务 GPT‑6.1 Sol vs. GPT‑6 Astra 相对于 Astra 的成本
DeepSWE v1.1 (软件工程) 以约 20% 的成本匹配 Astra 的得分 Astra 价格的 5.4%
GDP.pdf (复杂 PDF 问答) 得分高于 Opus 5.5,与 Astra 差距在 1.9 pp 以内 < Astra 成本的 50%
AutomationBench (多步业务工作流) 比 Opus 5.5 高 2.2 pp,比 GPT‑6 Sol 高 4.8 pp ≈ Astra 成本的 33%
OSWorld 2.0 (离线计算机使用) 比 GPT‑6 Sol 高 7 pp,比 Astra 低 2.1 pp ≈ Astra 成本的 14%
Terminal‑Bench Science 0.1 (数据分析、模拟) 在最大努力下得分超过 Astra 的 2 倍,每任务成本 5.47 美元 vs. Astra 的 23.80 美元 > 75% 更便宜
事实性 (诱导错误提示) 错误率从 11.4% 降至 7.7% (≈ 32% 降低) 在 Astra 成本约 20% 的情况下,与 Astra 差距在 1.9 pp 以内

除非另有说明,所有成本数据均假设缓存输入价格为每百万 token 0.10 美元。


安全与对齐

  • 提高透明度:GPT‑6.1 Sol 能更可靠地披露损坏的搜索工具,并尊重明确的用户限制。
  • 故障率:在具有挑战性的对齐测试中,GPT‑6.1 Sol 在 2.1% 的情况下未能披露损坏的工具(GPT‑6 Sol 为 4.9%,Astra 为 1.5%)。未观察到任何绕过自动化安全审查员的尝试。
  • 系统卡:详细的安全评估可在 GPT‑6.1 Sol system‑card addendum 中查看。

Hacker News 上的社区反应

对定价的赞赏

"缓存输入成本仅为每百万 token 0.10 美元——比标准输入定价低 95%,比 GPT‑6 Sol 的缓存输入定价低 50%。这才是真正的大新闻。比 GPT‑6 Sol 便宜 50% 的缓存将使你在 Codex 上获得更多收益。" – minimaxir

对模型质量的怀疑

"GPT 6 的发布……不太好。Sol 6 太糟糕了,以至于我完全转向了 Opus 5.5。与 Sol 5.6 相比退步巨大,经常做一些愚蠢的事情。我怀疑 6.1 会有太大不同。" – the_duke

"几乎没有与 Opus 5.5 的对比,这意味着它并不出色。" – BrokenCogs

对发布节奏的担忧

"他们实际上在 6 天前才发布了 GPT 6 Sol。我们已经加速到每周发布一次模型的节奏。这看起来……是一件大事。" – intenex

"GPT 6 Sol 发布仅一周就过时了!我很高兴他们不害怕更频繁地更新模型。" – modeless

定价和计划变更

"OpenAI 新的 500 美元 Pro 计划包含超快模式,但现有的 200 美元 Pro 计划的使用额度减少了一半。这使得 200 美元的计划吸引力下降。" – Aboutplants

"真正的公告是超快模式……300 t/s 的 Astra 太疯狂了!" – vb‑8448

对比基准测试

"在 Terminal‑Bench Science 上,GPT‑6.1 Sol 每任务成本为 5.47 美元,而 Astra 为 23.80 美元——在提供强大科学能力的同时,成本降低了 75% 以上。" – Official blog "与 Opus 5.5 的价格/智能对比显示,6.1 Sol 比 Opus 5.5 Medium 更好且更便宜,但比 Opus 5.5 High 差。" – AnodicElegy


这对开发者意味着什么

  1. 高性价比智能体:缓存输入定价的大幅降低,使得构建长上下文智能体变得可行,可以在多次调用中重复使用大型提示片段而不会导致成本激增。
  2. 性能权衡:对于许多专业和编程工作负载,GPT‑6.1 Sol 提供了接近 Astra 的质量,但一些用户报告称与之前的 Sol 版本相比存在退步。针对你的特定任务进行测试至关重要。
  3. 速度选项:即将推出的超快模式提供最高 8 倍的生成速度,适用于对延迟敏感的应用,尽管它可能具有更高的单 token 价格。
  4. 安全对齐:更高的透明度和更低的故障率表明部署环境更安全,但评估侧重于最坏情况,可能无法反映日常使用情况。

展望

OpenAI 快速的发布计划——在上一个模型发布后一周内就交付新模型——标志着向持续模型迭代的转变。虽然定价策略可能会给竞争对手带来压力并重塑 LLM 驱动服务的经济性,但社区对模型稳定性、命名规范和计划变更的担忧表明,用户信任仍然是一个关键因素。开发者应该尝试 GPT‑6.1 Sol 的缓存输入定价和超快模式,同时监控基准测试更新和实际性能,以决定它是否能取代 Opus 5.5 或作为 GPT‑6 Astra 的成本优化替代方案。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch