OpenAI GDPval:実世界の知識労働におけるモデル性能の測定
OpenAIはGDPvalという新しい評価フレームワークを導入し、経済的に価値のある実世界のタスクにおけるAIモデルの性能を追跡できるようにしました。米国の国内総生産(GDP)に最も大きく貢献する産業と職業からタスクを抽出することで、GDPvalはAI評価を学術的ベンチマークから実際のプロフェッショナルな生産性の測定へとシフトさせます。
GDPval フレームワークと方法論
GDPvalは、米国GDPの5%以上を占める上位9つの産業にまたがる44の職業にわたってモデル性能を測定します。評価は1,320の専門タスクで構成され、そのうち「ゴールド」オープンソースセットとして220タスクが提供されています。
タスク選択と設計
経済的関連性を確保するため、OpenAIは職業に対して特定の選択プロセスを使用しました:
- Industry Selection(産業選択): セントルイス連邦準備銀行のデータに基づき、米国GDPの5%以上を占める上位9つの産業が選択されました。
- Occupation Selection(職業選択): それらの産業内で、総賃金と報酬への貢献度が最も高い5つの職業が選ばれ、なおかつ主に知識労働であることが条件とされました。
- Knowledge Work Threshold(知識労働の閾値): O*NETデータを使用し、構成タスクの少なくとも60%が肉体労働や手作業を伴わない場合、その職業は資格を得ました。
データセット構築
タスクは平均14年の経験を持つ専門家によって作成されました。各タスクは、看護ケアプラン、エンジニアリング図面、法的ブリーフなどの実際の作業成果物に基づいており、合成された試験問題ではありません。各タスクは平均5回の専門家レビューを受け、モデルベースの検証やピアチェックを含めて、代表性と実現可能性が確保されています。
従来のベンチマークとは異なり、GDPvalのタスクは参照ファイルとコンテキストを含み、スプレッドシート、図、スライド、またはマルチメディア文書などの成果物が求められます。
モデル性能と評価
モデル性能は、同じ専門分野の専門家「評価者」によるブラインド比較で評価されます。これらの評価者は、AIが生成した成果物を人間が作成したものと比較し、「より優れている」「同等」「人間の専門家より劣っている」に分類します。
主な発見とベンチマーク
GPT-4o、o4-mini、OpenAI o3、GPT-5、Claude Opus 4.1、Gemini 2.5 Pro、Grok 4 を含むブラインド評価で以下が明らかになりました:
- Human Parity(人間と同等): フロンティアモデルは業界の専門家と同等の品質に近づいています。Claude Opus 4.1は、タスクのほぼ半数で人間と同等またはそれ以上と評価され、特に美的感覚とレイアウトに強みを示しました。
- Accuracy(正確性): GPT-5は正確性と領域固有の知識において特に優れた成果を示しました。
- Growth Trend(成長傾向): GPT-4o(2024年春)からGPT-5(2025年夏)までの性能は2倍以上に向上し、線形の傾向を示しています。
- Efficiency(効率性): フロンティアモデルはこれらのタスクを人間の専門家に比べて約100倍速く、100倍低コストで完了できますが、これらの数値は推論とAPIコストのみを考慮しており、人間の監督は含まれていません。
自動評価
OpenAIは「自動評価者」を開発しました。これは人間の専門家の判断を予測するように訓練されたAIシステムです。evals.openai.com で実験的な研究サービスとして提供されていますが、信頼性のギャップがあるため、まだ人間の専門家評価者の代替には使用されていません。
制限事項と今後の開発
GDPvalは現在、ワンショット評価であり、クライアントのフィードバックに基づく文書の修正など、プロフェッショナルな作業の反復的な性質を捉えていません。また、実世界のタスクに内在する曖昧さ、すなわち専門家がまず正しいアプローチを決定してから成果物を作成する必要がある点も考慮されていません。
GDPvalの今後のバージョンでは、以下を目指します:
- カバーする職業と産業の数を拡大する。
- インタラクティブなワークフローと複数ドラフトの反復を組み込む。
- 曖昧さを乗り越える必要があるタスクを含め、プロフェッショナルな知識労働の複雑さをより正確に反映させる。