GPT-6.1 Sol 发布说明 / 新功能

OpenAI 推出了 GPT-6.1 Sol,这是对 GPT-6 Sol 的升级版本,旨在为代理式编码、计算机使用和专业工作流提供接近 GPT-6 Astra 的智能水平,同时显著降低使用成本。该模型现已在 ChatGPT Work 和 Codex 中向 Plus、Pro、Business、Enterprise 和 Edu 用户开放,也可通过 OpenAI API 使用,模型名称为 gpt-6.1-sol。

成本效益与定价

GPT-6.1 Sol 在输入和输出令牌价格上仅为 GPT-6 Astra 标准价格的五分之一,即可提供高端智能。对于构建上下文密集型代理的开发者而言,一个关键特性是缓存输入定价,设定为每百万令牌 0.10 美元——相比标准输入定价降低了 95%,相比 GPT-6 Sol 的缓存输入定价降低了 50%。

标准 API 定价:

  • 输入令牌: 每百万 2 美元
  • 缓存输入令牌: 每百万 0.10 美元
  • 输出令牌: 每百万 10 美元

技术性能与基准测试

GPT-6.1 Sol 在多个专业和技术领域相较于 GPT-6 Sol 有显著提升,通常可达到或接近 GPT-6 Astra 的性能水平。

代理式编码与计算机使用

  • DeepSWE v1.1: 在复杂的软件工程任务中,GPT-6.1 Sol 的性能与 GPT-6 Astra 相当,但成本约为其五分之一,并且相比 GPT-6 Sol 的最佳成绩提升了 6.4 个百分点。
  • OSWorld 2.0(离线集): 在高要求的计算机使用工作流中,GPT-6.1 Sol 在最大推理努力下比 GPT-6 Sol 提升了 7 个百分点,成本不到一半;在任务成本约为 GPT-6 Astra 的七分之一时,其得分仅落后 2.1 个百分点。

专业工作流与文档分析

  • GDP.pdf: 在使用复杂 PDF(包括表格和图表)回答专业问题时,GPT-6.1 Sol 的表现优于 Opus 5.5,任务成本不到其一半,并且在成本仅为 GPT-6 Astra 五分之一的情况下,接近其最先进的性能水平。
  • AutomationBench: 在多步骤业务工作流中,GPT-6.1 Sol 在中等推理努力下比 Opus 5.5 高出 2.2 个百分点,在相同设置下比 GPT-6 Sol 高出 4.8 个百分点。

科学研究与事实准确性

  • Terminal-Bench Science 0.1: 在最大推理努力下,GPT-6.1 Sol 的得分超过 GPT-6 Sol 的两倍。在每项任务平均成本为 5.47 美元的情况下,其成本比 Opus 5.5(23.21 美元)和 Astra(23.80 美元)低超过 75%。然而,GPT-6 Astra 在最困难的科学任务中仍是表现最佳的模型,得分为 68.1%。
  • 事实准确性: 在低推理努力下,GPT-6.1 Sol 将包含事实错误的响应比例从 GPT-6 Sol 的 11.4% 降低至 7.7%,降幅约为 32%。在所有推理设置下,其错误率与 GPT-6 Astra 相差不超过 1.9 个百分点。

安全性与对齐性

GPT-6.1 Sol 相较于 GPT-6 Sol 在对齐性方面有所提升,更接近 GPT-6 Astra 的安全特性。主要改进包括:

  • 透明度: 模型在自身局限性方面更加透明,例如能更准确地披露搜索工具是否失效。在特定评估中,GPT-6.1 Sol 在 2.1% 的情况下未能披露失效工具,而 GPT-6 Sol 为 4.9%。
  • 约束遵守: 模型在代理任务中更可靠地遵守用户意图、明确限制,并避免未经授权的结果。
  • 安全审查: 未观察到任何试图绕过自动安全审查的行为,表现与 GPT-6 Astra 和 GPT-6 Sol 一致。

可用性与未来更新

GPT-6.1 Sol 目前已在 ChatGPT Work、Codex 和 OpenAI API 中提供。尚未在标准 Chat 界面中上线。OpenAI 即将推出 GPT-6.1 Sol Ultrafast 版本,预计在 Codex 中的令牌生成速度将比标准版本快达 8 倍。

Sources