OpenAI 人工智能时代的评分卡

OpenAI 人工智能时代的评分卡

OpenAI 推出 “Useful Intelligence per Dollar” 框架

OpenAI 已提出一种衡量 AI 在商业中的经济价值的新指标:“Useful Intelligence per Dollar。” 该框架将焦点从传统的软件采用指标(如购买的席位或活跃用户)转移到实际完成的工作量上。

根据 OpenAI 的说法,企业领袖的核心经济问题是:AI 完成的工作价值是否增长速度快于其生产成本。这需要超越每 token 成本,考虑生成成功结果的全部成本,包括人工审查、重试和返工。

衡量有用工作和任务完成

为了确定 AI 的价值,组织必须首先为特定工作流定义“完成”意味着什么,并在工作发生的系统中测量结果。只有当 token 被转化为可用工作时(例如解决客户问题、交付代码更改或审查合同)才会产生价值。

OpenAI 强调,随着模型能力的提升,它们能够处理涉及多步骤推理和工具集成的更长、更复杂的任务。例如,在金融工作流中,AI 可以自动化数据收集和对账过程,使人类团队能够专注于高层次的判断和创造力。

计算每个成功任务的全部成本

OpenAI 认为,每 token 的最低价格并不总是导致每个结果的最低成本。如果一个更强大的前沿模型能够在一次通过中获得正确结果,减少对人工审查和多次重试的需求,那么它可能更具成本效益。

GPT-5.6 模型系列

OpenAI 最近发布了 GPT-5.6 系列,提供三个层级以帮助客户优化成本与性能方程:

  • Sol:旗舰模型,用于最强的推理和复杂任务。
  • Terra:在性能和成本之间取得平衡的模型。
  • Luna:速度最快、最实惠的模型,适用于高吞吐量工作流。

性能和效率基准

GPT-5.6 Sol(最大推理)在 Artificial Analysis Coding Agent Index 上设定了新的最先进水平。具体来说,在用于长时程工程任务的 DeepSWE v1.1 基准上,GPT-5.6 Sol 达到了 72.7% 的得分,超过了 Claude Fable 5 的 69.9%,同时保持了 36.2% 更低的估计 API 成本

此外,GPT-5.6 Sol 达到这些结果所使用的输出 token 比另一个领先模型少了 54%

评估可靠性和可靠性

可靠性具有直接的经济价值,因为准确且一致的结果可以减少在纠正和重复上花费的时间。OpenAI 建议跟踪三个具体结果来衡量 AI 的可靠性:

  1. Ready to use:交付的结果已达到质量标准。
  2. Needs correction:结果需要人工编辑或另一次尝试。
  3. Needs escalation:需要人工介入以完成工作。

为了让 AI 从草稿过渡到执行行动,OpenAI 强调需要明确数据访问、系统权限和人工批准触发器的边界。这一点通过 ChatGPT Work 得到支持,ChatGPT Work 利用 ChatGPT Enterprise 的安全和合规基础,以实现更深层次的工作流集成。

扩展 AI 价值及计算的作用

OpenAI 断言,当完成的工作增长速度快于总成本且质量保持稳定或提升时,AI 投资的回报率会随着规模扩大而提升。

计算是此方程的核心驱动力。研究、推理效率、专用硬件和更智能路由的改进将转化为客户的更好结果。这会产生复合效应:更好的基础设施加速研究,研究产生更高效的模型,而这些模型又推动采用和收入,以支持对下一代计算和安全的进一步投资。

Sources