OpenAI AI時代的評分卡

OpenAI AI時代的評分卡

OpenAI 推出「每美元有用智慧」框架

OpenAI 已提出一項衡量 AI 在商業中的經濟價值的新指標:「每美元有用智慧。」此框架將焦點從傳統的軟體採用指標(例如購買的座位數或活躍使用者)轉移到實際完成的工作量上。

根據 OpenAI,商業領導者的核心經濟問題是 AI 完成的工作價值是否增長速度快於其生產成本。這需要超越每 token 成本,考慮產生成功結果的完整成本,包括人工審查、重試和返工。

衡量有用工作與任務完成

為了決定 AI 的價值,組織必須先為特定工作流程定義「完成」的含義,並在工作發生的系統中衡量結果。只有當 token 被轉化為可用工作時才會創造價值,例如解決客戶問題、發送程式碼變更變更換或審查合約。

OpenAI 強調,隨著模型變得更強大,它們能夠處理涉及多步驟推理和工具整合的更長、更複雜的任務。例如,在金融工作流程中,AI 可以自動化數據收集與對帳流程,使人類團隊能夠專注於高層次的判斷與創造。

計算每項成功任務的完整成本

OpenAI 認為,每 token 的最低價格不一定會帶來最低的每項結果成本。如果一個更強大的前沿模型能夠在一次傳遞中獲得正確結果,則可能更具成本效益,因為這減少了對人工審查和多次重試的需求。

GPT-5.6 模型系列

  • Sol: 用於最強推理和複雜任務的旗艦模型。
  • Terra: 在效能與成本間取得平衡的模型。
  • Luna: 最快且最實惠的模型,適用於高吞吐量工作流程。

效能與效率基準

GPT-5.6 Sol(最大推理)在 Artificial Analysis Coding Agent Index 上設定了新的最先進水準。具體來說,在用於長期工程任務的 DeepSWE v1.1 基準上,GPT-5.6 Sol 獲得了 72.7% 的分數,超越了 Claude Fable 5 的 69.9%,同時保持了 36.2% 更低的估計 API 成本

此外,GPT-5.6 Sol 相比另一個領先模型使用了 54% 更少的輸出 token 來達到這些結果。

評估可靠性與可信度

可靠性具有直接的經濟價值,因為準確且一致的結果可以減少在糾正和重複上花費的時間。OpenAI 建議追蹤三個具體結果來衡量 AI 的可靠性:

  1. Ready to use:結果在交付時已達到品質標準。
  2. Needs correction:結果需要人工編輯或另一次嘗試。
  3. Needs escalation:需要人類介入並完成工作。

為了讓 AI 從草擬階段進入執行階段,OpenAI 強調需要針對資料存取、系統權限和人類批准觸發點設定明確的界限。這由 ChatGPT Work 支持,它利用 ChatGPT Enterprise 的安全與合規基礎,以允許更深層的工作流程整合。

擴展 AI 價值與運算的角色

OpenAI 斷言,當完成的工作增長速度快於總成本且品質保持穩定或提升時,AI 投資的回報率會隨規模擴大而提升。

運算是此方程式的核心驅動力。研究、推理效率、專用硬體和更智慧的路由的改進將轉化為客戶的更好結果。這會產生複利效應:更好的基礎設施加速研究,研究產出更高效的模型,進而推動採用和收入,以支持對下一代運算與安全的進一步投資。

Sources