OpenAI 人工智能时代的评分卡
OpenAI 人工智能时代的评分卡
OpenAI 推出 “Useful Intelligence per Dollar” 框架
OpenAI 已提出一种衡量 AI 在商业中的经济价值的新指标:“Useful Intelligence per Dollar。” 该框架将焦点从传统的软件采用指标(如购买的席位或活跃用户)转移到实际完成的工作量上。
根据 OpenAI 的说法,企业领袖的核心经济问题是:AI 完成的工作价值是否增长速度快于其生产成本。这需要超越每 token 成本,考虑生成成功结果的全部成本,包括人工审查、重试和返工。
衡量有用工作和任务完成
为了确定 AI 的价值,组织必须首先为特定工作流定义“完成”意味着什么,并在工作发生的系统中测量结果。只有当 token 被转化为可用工作时(例如解决客户问题、交付代码更改或审查合同)才会产生价值。
OpenAI 强调,随着模型能力的提升,它们能够处理涉及多步骤推理和工具集成的更长、更复杂的任务。例如,在金融工作流中,AI 可以自动化数据收集和对账过程,使人类团队能够专注于高层次的判断和创造力。
计算每个成功任务的全部成本
OpenAI 认为,每 token 的最低价格并不总是导致每个结果的最低成本。如果一个更强大的前沿模型能够在一次通过中获得正确结果,减少对人工审查和多次重试的需求,那么它可能更具成本效益。
GPT-5.6 模型系列
OpenAI 最近发布了 GPT-5.6 系列,提供三个层级以帮助客户优化成本与性能方程:
- Sol:旗舰模型,用于最强的推理和复杂任务。
- Terra:在性能和成本之间取得平衡的模型。
- Luna:速度最快、最实惠的模型,适用于高吞吐量工作流。
性能和效率基准
GPT-5.6 Sol(最大推理)在 Artificial Analysis Coding Agent Index 上设定了新的最先进水平。具体来说,在用于长时程工程任务的 DeepSWE v1.1 基准上,GPT-5.6 Sol 达到了 72.7% 的得分,超过了 Claude Fable 5 的 69.9%,同时保持了 36.2% 更低的估计 API 成本。
此外,GPT-5.6 Sol 达到这些结果所使用的输出 token 比另一个领先模型少了 54%。
评估可靠性和可靠性
可靠性具有直接的经济价值,因为准确且一致的结果可以减少在纠正和重复上花费的时间。OpenAI 建议跟踪三个具体结果来衡量 AI 的可靠性:
- Ready to use:交付的结果已达到质量标准。
- Needs correction:结果需要人工编辑或另一次尝试。
- Needs escalation:需要人工介入以完成工作。
为了让 AI 从草稿过渡到执行行动,OpenAI 强调需要明确数据访问、系统权限和人工批准触发器的边界。这一点通过 ChatGPT Work 得到支持,ChatGPT Work 利用 ChatGPT Enterprise 的安全和合规基础,以实现更深层次的工作流集成。
扩展 AI 价值及计算的作用
OpenAI 断言,当完成的工作增长速度快于总成本且质量保持稳定或提升时,AI 投资的回报率会随着规模扩大而提升。
计算是此方程的核心驱动力。研究、推理效率、专用硬件和更智能路由的改进将转化为客户的更好结果。这会产生复合效应:更好的基础设施加速研究,研究产生更高效的模型,而这些模型又推动采用和收入,以支持对下一代计算和安全的进一步投资。
Sources
- OriginalA scorecard for the AI age