OpenAI AI時代のスコアカード

OpenAI AI時代のスコアカード

OpenAIは「Useful Intelligence per Dollar」フレームワークを導入

OpenAIは、ビジネスにおけるAIの経済価値を測定する新しいメトリクスとして「Useful Intelligence per Dollar」を提案しました。このフレームワークは、購入されたシート数やアクティブユーザー数などの従来のソフトウェア導入メトリクスから焦点をずらし、実際に達成された仕事を測定するものです。

OpenAIによれば、ビジネスリーダーにとっての中心的な経済的疑問は、AIが完了する仕事の価値がその生産コストよりも速く成長しているかどうかです。これは、人間のレビュー、リトライ、再作業を含む成功した結果の生産にかかる総コストを見ることを意味し、単純なコストパートークンだけを見るわけではありません。

有用な仕事とタスク完了の測定

AIの価値を決定するために、組織はまず特定のワークフローにおける「完了」の意味を定義し、仕事が発生するシステムでの成果を測定しなければなりません。トークンません。トークンは、顧客の問題の解決、コード変更のリリース、契約のレビューなど、使用可能な仕事に変換されたときにのみ価値を生み出します。

OpenAIは、モデルがより能力を高めると、マルチステップ推論とツール統合を含むより長く複雑なタスクを処理できるようになることを強調しています。たとえば、ファイナンスワークフローでは、AIがデータ収集と調整プロセスを自動化し、人間のチームが高レベルの判断と創造性に集中できるようにします。

成功したタスクあたりの総コストの計算

OpenAIは、トークンあたりの価格が最低でも、その結果あたりのコストが最低になるわけではないと主張しています。より能力の高いフロンティアモデルは、一度のパスで正しい結果を達成すれば、人間のレビューや複数のリトライの必要性を減らすことができ、よりコスト効果が高くなる可能性があります。

GPT-5.6 モデルファミリー

  • Sol: 最も強力な推論と複雑なタスク向けのフラッグシップモデル。
  • Terra: パフォーマンスとコストのバランスが取れたモデル。
  • Luna: 高ボリュームワークフロー向けに最も高速かつ手頃な価格のモデル。

パフォーマンスと効率のベンチマーク

GPT-5.6 Sol(最大推論時)は、Artificial Analysis Coding Agent Indexで新たな最先端を記録しました。具体的には、長期間のエンジニアリングタスク向けのDeepSWE v1.1ベンチマークにおいて、GPT-5.6 Solはスコア**72.7%を達成し、Claude Fable 5の69.9%**を上回りながら、36.2%低い推定APIコストを維持しました。

さらに、GPT-5.6 Solはこれらの結果を達成するために、他の主要なモデルよりも出力トークンを54%少なく使用しました。

依存性と信頼性の評価

正確で一貫した結果は修正と繰り返しに費やす時間を減らすため、依存性には直接的な経済的価値があります。OpenAIは、AIの依存性を測定するために、以下の3つの具体的な成果を追跡することを提案しています:

  1. Ready to use: 結果は提供された状態で品質基準を満たしています。
      1. Needs correction: 結果は人間による編集またはもう1回の試みが必要です。
  2. Needs escalation: 人間が介入して仕事を完了する必要がありました。

AIをドラフトから実際の行動に移すため、OpenAIはデータアクセス、システム権限、人間の承認トリガーに関する明確な境界の必要性を強調しています。これは、ChatGPT Workによってサポートされており、ChatGPT Enterpriseのセキュリティとコンプライアンスの基盤を利用して、より深いワークフロー統合を可能にしています。

AI価値のスケーリングとコンピューティングの役割

OpenAIは、完了した仕事の成長が総コストよりも速く、品質が安定しているか向上している場合、スケールにおいてAI投資のリターンが向上すると主張しています。

コンピューティングはこの方程式の中心的な駆動力です。研究、推論効率、目的別ハードウェア、スマートなルーティングの改善は、顧客にとってより良い結果につながります。これにより、複合効果が生まれます:より良いインフラストラクチャが研究を加速し、より効率的なモデルを生み出し、それが導入と収益を促進して、次世代のコンピューティングと安全性へのさらなる投資を支えます。

Sources