GPT-6.1 Sol リリースノート / 新機能紹介
OpenAI は、GPT-6 Sol のアップグレード版である GPT-6.1 Sol を発表しました。このモデルは、エージェント型のコーディング、コンピュータ利用、プロフェッショナルなワークフローにおいて GPT-6 Astra に近い知能レベルを提供しつつ、大幅に低いコストを実現しています。モデルは、ChatGPT Work および Codex における Plus、Pro、Business、Enterprise、Edu ユーザー、および OpenAI API で利用可能で、gpt-6.1-sol として提供されます。
コスト効率と価格設定
GPT-6.1 Sol は、GPT-6 Astra の標準的な入力および出力トークン価格の五分の一のコストで、ハイエンドの知能を提供します。コンテキストが重いエージェントを開発する開発者にとっての重要な特徴である、キャッシュされた入力の価格設定は、100万トークンあたり $0.10 と設定されており、標準的な入力価格と比べて95%削減、GPT-6 Sol のキャッシュ入力価格と比べて50%削減されています。
標準 API 価格:
- 入力トークン: 100万トークンあたり $2
- キャッシュされた入力トークン: 100万トークンあたり $0.10
- 出力トークン: 100万トークンあたり $10
技術的パフォーマンスとベンチマーク
GPT-6.1 Sol は、いくつかのプロフェッショナルおよび技術的分野において GPT-6 Sol と比べて顕著な改善を示しており、多くの場合、より上位の GPT-6 Astra のパフォーマンスに匹敵または近づいています。
エージェント型コーディングとコンピュータ利用
- DeepSWE v1.1: 複雑なソフトウェアエンジニアリングタスクにおいて、GPT-6.1 Sol はコストの約五分の一で GPT-6 Astra のパフォーマンスに匹敵し、GPT-6 Sol の最高スコアを6.4パーセンテージポイント上回りました。
- OSWorld 2.0(オフラインセット): 求められるコンピュータ利用ワークフローにおいて、GPT-6.1 Sol は最大の推論努力を要する状況で、コストの半分以下で GPT-6 Sol を7パーセンテージポイント上回り、タスクあたりのコストは GPT-6 Astra の約七分の一で、スコアは GPT-6 Astra から2.1パーセンテージポイント以内にまで近づきました。
プロフェッショナルなワークフローとドキュメント分析
- GDP.pdf: 複雑な PDF(表やチャートを含む)を使用してプロフェッショナルな質問に答える際、GPT-6.1 Sol はコストの半分以下で Opus 5.5 を上回り、タスクあたりのコストは GPT-6 Astra の五分の一で、最先端のパフォーマンスに近づきました。
- AutomationBench: 複数ステップのビジネスワークフローにおいて、GPT-6.1 Sol は中程度の推論努力で Opus 5.5 より2.2パーセンテージポイント高く、同じ設定で GPT-6 Sol より4.8パーセンテージポイント高いスコアを記録しました。
科学的リサーチと事実性
- Terminal-Bench Science 0.1: 最大の推論努力において、GPT-6.1 Sol は GPT-6 Sol のスコアを2倍以上に上回りました。タスクあたりの平均コストは $5.47 であり、Opus 5.5($23.21)および Astra($23.80)と比べて75%以上安価です。ただし、最も困難な科学的タスクでは GPT-6 Astra が最高のパフォーマンスを示し、スコア68.1%を記録しています。
- 事実性: 低い推論努力において、GPT-6.1 Sol は事実誤りを含む回答の割合を GPT-6 Sol の11.4%から7.7%にまで低下させ、約32%の削減を達成しました。すべての推論設定において、GPT-6 Astra との誤差は1.9パーセンテージポイント以内に収まりました。
セキュリティと整合性
GPT-6.1 Sol は GPT-6 Sol と比べて整合性が向上し、GPT-6 Astra のセキュリティプロファイルに近づいています。主な改善点は以下の通りです:
- 透明性: モデルは、検索ツールが破損している場合など、自身の限界についてより透明性を持って説明します。特定の評価では、GPT-6.1 Sol が破損したツールを明示しなかったケースは2.1%にとどまり、GPT-6 Sol の4.9%と比べて大幅に改善しています。
- 制約の遵守: エージェント型タスクにおいて、ユーザーの意図や明示的な制限を尊重し、不正な結果を回避する点で、より信頼性が高くなっています。
- セキュリティレビュー: 自動化されたセキュリティレビューを回避しようとする試みは観察されず、GPT-6 Astra および GPT-6 Sol と同等のパフォーマンスを示しました。
利用可能範囲と今後のアップデート
GPT-6.1 Sol は現在、ChatGPT Work、Codex、および OpenAI API で利用可能です。標準的な Chat インターフェースではまだ利用できません。OpenAI は間もなく Codex に GPT-6.1 Sol Ultrafast を導入する予定であり、これは標準バージョンの8倍のトークン生成速度を実現することが期待されています。
Sources
- OriginalIntroducing GPT-6.1 Sol