OpenAIがGPT-6 SolとGPT-6 Lunaを発表

TL;DR

OpenAIは、GPT‑6 Astraのコスト効率に優れた後継モデルであるGPT‑6 SolとGPT‑6 Lunaをリリースしました。GPT‑5.6と比較してAPI価格を半額に抑えつつ、プロフェッショナルなタスク、事実性、コーディング、コンピュータ使用ワークロードにおいて高いパフォーマンスを維持しています。

GPT‑6ファミリーの拡張概要

OpenAIは、主力モデルであるGPT‑6 Astraを補完する形でGPT‑6 SolとGPT‑6 Lunaを導入しました。3モデルとも同じトレーニング手法を採用していますが、SolとLunaは低レイテンシと低推論コストを最適化しています。キャッシュと推論インフラの改善により、GPT‑5.6のプロモーション価格と比較して50 %の価格引き下げが実現し、日常的なアプリケーションにおける高度なAIの利用をより広く可能にしました。

API価格の引き下げ

モデル 入力価格(1Mトークンあたり) 出力価格(1Mトークンあたり) 相対的な削減率
GPT‑6 Sol $4 → $2 $20 → $10 50 %安価
GPT‑6 Luna $0.20 → $0.10 $1.20 → $0.50 50 %安価

価格は100万トークンあたりで提示されています。GPT‑6 Astraは、最高の結果が必要なユーザー向けのトップレベルモデルのままです。

プロフェッショナルタスクにおけるパフォーマンス

主な成果

GPT‑6 Solは、AutomationBenchベンチマークにおいてClaude Opus 5を上回りながら、タスクあたりのコストはOpus 5の9 %にとどまります。GPT‑6 Lunaは、前モデル比で5.4ポイント向上し、コストは58 %低く抑えられています。

詳細な比較

  • AutomationBench 1.0.6 は、47のツールを横断するエンドツーエンドのワークフローでAIエージェントを評価します。GPT‑6 Sol(xhigh effort)は33.2 %のスコアを記録し、タスクあたりのコストは$0.27。スコアとコストの両面で、GPT‑6 Astra(low effort)およびClaude Opus 5(max effort)を上回っています。
  • Agents’ Last Exam では、GPT‑6 Sol(max effort)が**56.4 %**を達成し、Claude Opus 5を上回りながら、タスクあたりのコストを60 %削減しています。

事実性の向上

OpenAIの内部事実性ベンチマークにおいて、GPT‑6 SolはGPT‑5.6 Solと比較して約半分の事実誤認を記録し、コストの数分の1でAstraに近い信頼性を実現しています。GPT‑6 Lunaも大幅な進歩を遂げており、高努力レベルで実行した場合、GPT‑5.6 Solと同等の事実性を、コストは約100分の1で達成しています。

コーディング能力とコスト効率

主な成果

FrontierCodeおよびDeepSWE v1.1ベンチマークにおいて、GPT‑6 Solはトップ競合モデルと同等のコーディング品質を実現しつつ、タスクあたりのコストを最大80 %まで削減しています。

ベンチマークの詳細

  • FrontierCode: GPT‑6 SolはGPT‑5.6 Solを上回り、Claude Fable 5.1(xhigh effort)と同等のスコアを達成する一方で、はるかに低いコストで実現しています。
  • DeepSWE v1.1: GPT‑6 Sol(max effort)は**68.8 %のスコアを記録し、Claude Fable 5の最高スコアから1.1ポイント以内にとどまり、タスクあたりのコストは約80 %低く抑えられています。GPT‑6 Luna(max effort)は66.6 %**を記録し、Claude Opus 5およびClaude Fable 5(medium effort)と同等の性能を実現しながら、タスクあたりのコストは93 %~96 %削減されています。

コンピュータ使用におけるパフォーマンス

GPT‑6 Sol(xhigh effort)は、OSWorld 2.0のオフラインテストで**60.5 %**のスコアを達成し、Claude Opus 5(medium effort)と同等の性能を実現しながら、コストは約80 %低く抑えられています。GPT‑6 Luna(max effort)は、GPT‑5.6 Sol(medium effort)を上回りながら、コストはたったの10分の1です。

拡張された協調スタイル

SolとLunaは、Astraの洗練されたコミュニケーションスタイルを引き継いでいます。説明が明確になり、専門用語が減り、不要な詳細が削減され、内容を損なわずわずかに短い回答が可能になっています。例の比較では、SolがGPT‑5.6の前モデルよりもより慎重で正確な回答を提供していることが示されています。

エージェント向けプロンプトキャッシュの進化

OpenAIは、より高いデフォルトのキャッシュヒット率と、キャッシュされた入力トークンの読み取りに対して90 %の割引を導入しました。新しく登場した開発者ツールには以下が含まれます:

  • キャッシュ使用状況を可視化するPrompt Caching Dashboard
  • キャッシュの機会を逃した原因を特定する診断ツール
  • キャッシュされたコンテキストを保持する推論努力およびツール利用可能性の制御
  • キャッシュされたプロンプトの接頭辞を明示的に定義するブレークポイント GitHubの報告によると、これらの変更により、数十億回のリクエストにおいて、新規プロンプトトークン処理の割合が50 %以上削減され、Copilotの応答速度が向上しています。

アライメントの進展

SolとLunaは、Astraのアライメント改善を基盤としています。内部評価では、GPT‑5.6モデルと比較して、コーディングタスクにおける誤解を招く主張の発生率が低くなっています。報告された指標は意図的に困難なシナリオを対象としており、通常の使用状況における失敗率を反映しているわけではありません。詳細な結果は、GPT‑6 Astraのシステムカードに掲載されています。

利用可能時期

  • ChatGPT WorkとCodex: GPT‑6 SolとGPT‑6 Lunaは、Plus、Pro、Business、Enterprise、Eduの各層で利用可能。
  • 無料ユーザーおよびGoユーザー: デスクトップアプリ経由でGPT‑6 Lunaにアクセス可能。
  • API: gpt-6-solおよびgpt-6-lunaとして利用可能。
  • ChatGPT: 1日を通じて段階的に展開される予定。モデルがまだ表示されていない場合は、再試行が必要です。

すべての評価はOpenAIの研究環境またはAPI経由で実施されました。本番環境のChatGPTは、システムプロンプトやツールの違いにより異なる場合があります。競合モデルのスコアは、公開されている報告書から取得しています。

Sources